Skip to content

Modalità articolo (Paper Mode)

Trasforma un progetto di annotazione in un report di dataset in LaTeX compilabile con un solo comando. Distribuzioni delle etichette, statistiche di accordo con le citazioni corrette, tabelle degli annotatori, tempi e limitazioni.

Novità della v2.7.0

Ogni articolo su un dataset finisce allo stesso modo: ricostruire conteggi degli annotatori, statistiche di accordo, distribuzioni delle etichette e tempi a partire da file di output sparsi, per poi formattarli a mano in LaTeX. La modalità articolo lo fa con un solo comando.

bash
python -m potato.paper config.yaml -o paper_export

Un comando trasforma il progetto in un report di dataset in LaTeX compilabile, sezione dei metodi compresa.

L'output funziona interamente offline. Nessun LLM, nessun server, nessuna rete.

text
paper_export/
├── paper.tex        # compilable standalone; every section cut-paste-able
├── paper.bib        # citations for every metric used (+ Potato)
├── tables/*.csv     # each table as CSV, for your own styling
└── summary.json     # every computed number, machine-readable

paper.tex compila così com'è, e ogni paragrafo e ogni tabella stanno tra marcatori, così puoi riprendere intere sezioni e portarle in un manoscritto:

latex
%% === BLOCK: paragraph-annotation-methods ===
Annotators spent a median of 42 seconds per item (12.3 person-hours in total).
Inter-annotator agreement for \emph{politeness}, measured by Krippendorff's
$\alpha$ (nominal) \citep{krippendorff2004content} over the 214
multiply-annotated units, was $\alpha = 0.712$ (tentative agreement). ...
%% === END BLOCK: paragraph-annotation-methods ===

Che cosa genera

BloccoContenuto
paragraph-dataset-descriptionConteggi degli elementi, schemi, etichette, totali di annotatori ed etichette, pronti per una sezione sui dati
paragraph-annotation-methodsTempi, α di Krippendorff per schema, κ di Cohen media a coppie, tutto citato
table-distribution-<scheme>Una tabella booktabs con la distribuzione delle etichette per ciascuno schema, con i totali
table-annotatorsElementi, etichette e mediana dei secondi per elemento di ciascun annotatore
table-agreementα, κ media e interpretazione per schema rispetto alle soglie 0.667 e 0.8 di Krippendorff
paragraph-limitationsAvvertenze con numeri reali: unità con una sola annotazione, schemi con α bassa, gruppi ridotti di annotatori

Opzioni della CLI

FlagPredefinitoDescrizione
-o, --output-dirpaper_exportDove scrivere il report
--no-anonymizedisattivatoMantiene i nomi utente reali; per impostazione predefinita gli annotatori diventano A1..An

Note di metodo

  • La modalità articolo legge direttamente {output_annotation_dir}/<user>/user_state.json, risolto rispetto al file di configurazione, quindi funziona su progetti archiviati senza avviare un server.
  • L'α di Krippendorff (nominale) viene calcolato con simpledorff, la stessa implementazione della dashboard di amministrazione, sulle unità con due o più annotazioni. La κ di Cohen a coppie viene calcolata per ogni coppia di annotatori con due o più elementi in comune.
  • Gli schemi categorici (radio, likert, multiselect, select, bws) ottengono distribuzioni e accordo. Per multiselect l'accordo tratta ogni casella (elemento, etichetta) come un'unità codificata in binario. Gli schemi span e textbox sono indicati come non coperti.
  • I tempi provengono dai log comportamentali, usando total_time_ms e ripiegando sugli intervalli tra i timestamp di interazione, ignorando i vuoti superiori a un'ora.

Ulteriori letture