Skip to content

Paper-Modus

Ein Annotationsprojekt mit einem Befehl in einen kompilierbaren LaTeX-Datensatzbericht verwandeln. Label-Verteilungen, Übereinstimmungsstatistiken mit korrekten Zitationen, Annotatorentabellen, Zeitmessung und Einschränkungen.

Neu in v2.7.0

Jedes Datensatz-Paper endet gleich: Annotatorenzahlen, Übereinstimmungsstatistiken, Label-Verteilungen und Zeitmessungen aus verstreuten Ausgabedateien rekonstruieren und dann von Hand in LaTeX formatieren. Der Paper-Modus erledigt das mit einem Befehl.

bash
python -m potato.paper config.yaml -o paper_export

Ein Befehl verwandelt das Projekt in einen kompilierbaren LaTeX-Datensatzbericht, Methodenteil inklusive.

Die Ausgabe entsteht vollständig offline. Kein LLM, kein Server, kein Netzwerk.

text
paper_export/
├── paper.tex        # compilable standalone; every section cut-paste-able
├── paper.bib        # citations for every metric used (+ Potato)
├── tables/*.csv     # each table as CSV, for your own styling
└── summary.json     # every computed number, machine-readable

paper.tex kompiliert unverändert, und jeder Absatz und jede Tabelle steht zwischen Markern, sodass sich Abschnitte direkt in ein Manuskript übernehmen lassen:

latex
%% === BLOCK: paragraph-annotation-methods ===
Annotators spent a median of 42 seconds per item (12.3 person-hours in total).
Inter-annotator agreement for \emph{politeness}, measured by Krippendorff's
$\alpha$ (nominal) \citep{krippendorff2004content} over the 214
multiply-annotated units, was $\alpha = 0.712$ (tentative agreement). ...
%% === END BLOCK: paragraph-annotation-methods ===

Was erzeugt wird

BlockInhalt
paragraph-dataset-descriptionElementzahlen, Schemata, Labels, Annotator- und Label-Summen, fertig für einen Datenabschnitt
paragraph-annotation-methodsZeitmessung, Krippendorffs α je Schema, mittleres paarweises Cohens κ, alles mit Zitation
table-distribution-<scheme>Eine booktabs-Tabelle der Label-Verteilung je Schema, mit Summen
table-annotatorsElemente, Labels und Median-Sekunden pro Element für jeden Annotator
table-agreementα, mittleres κ und Interpretation je Schema gegenüber Krippendorffs Schwellen von 0,667 und 0,8
paragraph-limitationsEinschränkungen mit echten Zahlen: einfach annotierte Einheiten, Schemata mit niedrigem α, kleine Annotatorenpools

CLI-Optionen

FlagStandardBeschreibung
-o, --output-dirpaper_exportWohin der Bericht geschrieben wird
--no-anonymizeausEchte Benutzernamen behalten; standardmäßig werden Annotatoren zu A1..An

Methodische Hinweise

  • Der Paper-Modus liest {output_annotation_dir}/<user>/user_state.json direkt, aufgelöst relativ zur Konfigurationsdatei, und funktioniert damit auch bei archivierten Projekten, ohne einen Server zu starten.
  • Krippendorffs α (nominal) wird mit simpledorff berechnet, derselben Implementierung wie im Admin-Dashboard, über Einheiten mit zwei oder mehr Annotationen. Das paarweise Cohens κ wird je Annotatorenpaar mit zwei oder mehr gemeinsamen Elementen berechnet.
  • Kategoriale Schemata (radio, likert, multiselect, select, bws) erhalten Verteilungen und Übereinstimmung. Bei multiselect behandelt die Übereinstimmung jedes (Element, Label)-Kästchen als binär kodierte Einheit. Span- und Textbox-Schemata werden als nicht abgedeckt aufgeführt.
  • Die Zeitmessung stammt aus den Verhaltensprotokollen, über total_time_ms und ersatzweise über die Zeitspannen zwischen Interaktions-Zeitstempeln, wobei Lücken von über einer Stunde ignoriert werden.

Weiterführende Informationen