Modalità articolo (Paper Mode)
Trasforma un progetto di annotazione in un report di dataset in LaTeX compilabile con un solo comando. Distribuzioni delle etichette, statistiche di accordo con le citazioni corrette, tabelle degli annotatori, tempi e limitazioni.
Novità della v2.7.0
Ogni articolo su un dataset finisce allo stesso modo: ricostruire conteggi degli annotatori, statistiche di accordo, distribuzioni delle etichette e tempi a partire da file di output sparsi, per poi formattarli a mano in LaTeX. La modalità articolo lo fa con un solo comando.
python -m potato.paper config.yaml -o paper_export
L'output funziona interamente offline. Nessun LLM, nessun server, nessuna rete.
paper_export/
├── paper.tex # compilable standalone; every section cut-paste-able
├── paper.bib # citations for every metric used (+ Potato)
├── tables/*.csv # each table as CSV, for your own styling
└── summary.json # every computed number, machine-readable
paper.tex compila così com'è, e ogni paragrafo e ogni tabella stanno tra marcatori, così puoi riprendere intere sezioni e portarle in un manoscritto:
%% === BLOCK: paragraph-annotation-methods ===
Annotators spent a median of 42 seconds per item (12.3 person-hours in total).
Inter-annotator agreement for \emph{politeness}, measured by Krippendorff's
$\alpha$ (nominal) \citep{krippendorff2004content} over the 214
multiply-annotated units, was $\alpha = 0.712$ (tentative agreement). ...
%% === END BLOCK: paragraph-annotation-methods ===Che cosa genera
| Blocco | Contenuto |
|---|---|
paragraph-dataset-description | Conteggi degli elementi, schemi, etichette, totali di annotatori ed etichette, pronti per una sezione sui dati |
paragraph-annotation-methods | Tempi, α di Krippendorff per schema, κ di Cohen media a coppie, tutto citato |
table-distribution-<scheme> | Una tabella booktabs con la distribuzione delle etichette per ciascuno schema, con i totali |
table-annotators | Elementi, etichette e mediana dei secondi per elemento di ciascun annotatore |
table-agreement | α, κ media e interpretazione per schema rispetto alle soglie 0.667 e 0.8 di Krippendorff |
paragraph-limitations | Avvertenze con numeri reali: unità con una sola annotazione, schemi con α bassa, gruppi ridotti di annotatori |
Opzioni della CLI
| Flag | Predefinito | Descrizione |
|---|---|---|
-o, --output-dir | paper_export | Dove scrivere il report |
--no-anonymize | disattivato | Mantiene i nomi utente reali; per impostazione predefinita gli annotatori diventano A1..An |
Note di metodo
- La modalità articolo legge direttamente
{output_annotation_dir}/<user>/user_state.json, risolto rispetto al file di configurazione, quindi funziona su progetti archiviati senza avviare un server. - L'α di Krippendorff (nominale) viene calcolato con
simpledorff, la stessa implementazione della dashboard di amministrazione, sulle unità con due o più annotazioni. La κ di Cohen a coppie viene calcolata per ogni coppia di annotatori con due o più elementi in comune. - Gli schemi categorici (
radio,likert,multiselect,select,bws) ottengono distribuzioni e accordo. Per multiselect l'accordo tratta ogni casella (elemento, etichetta) come un'unità codificata in binario. Gli schemi span e textbox sono indicati come non coperti. - I tempi provengono dai log comportamentali, usando
total_time_mse ripiegando sugli intervalli tra i timestamp di interazione, ignorando i vuoti superiori a un'ora.
Ulteriori letture
- Documentare i dataset di annotazione
- Accordo tra annotatori
- Dashboard di amministrazione — gli equivalenti dal vivo di questi numeri
- Documentazione sorgente