Skip to content

Mode article

Transformez un projet d'annotation en rapport de jeu de données LaTeX compilable, en une seule commande. Distributions d'étiquettes, statistiques d'accord avec les bonnes citations, tableaux d'annotateurs, temps passé et limites.

Nouveau dans la v2.7.0

Tous les articles de jeu de données se terminent de la même façon : reconstituer le nombre d'annotateurs, les statistiques d'accord, les distributions d'étiquettes et les temps à partir de fichiers de sortie éparpillés, puis les mettre en forme à la main en LaTeX. Le mode article le fait en une commande.

bash
python -m potato.paper config.yaml -o paper_export

Une commande transforme le projet en rapport de jeu de données LaTeX compilable, section méthodes comprise.

La sortie fonctionne entièrement hors ligne. Aucun LLM, aucun serveur, aucun réseau.

text
paper_export/
├── paper.tex        # compilable standalone; every section cut-paste-able
├── paper.bib        # citations for every metric used (+ Potato)
├── tables/*.csv     # each table as CSV, for your own styling
└── summary.json     # every computed number, machine-readable

paper.tex compile tel quel, et chaque paragraphe et chaque tableau se trouvent entre des marqueurs, ce qui vous permet de reprendre des sections entières dans un manuscrit :

latex
%% === BLOCK: paragraph-annotation-methods ===
Annotators spent a median of 42 seconds per item (12.3 person-hours in total).
Inter-annotator agreement for \emph{politeness}, measured by Krippendorff's
$\alpha$ (nominal) \citep{krippendorff2004content} over the 214
multiply-annotated units, was $\alpha = 0.712$ (tentative agreement). ...
%% === END BLOCK: paragraph-annotation-methods ===

Ce qu'il génère

BlocContenu
paragraph-dataset-descriptionNombre d'éléments, schémas, étiquettes, totaux d'annotateurs et d'étiquettes, prêts pour une section Données
paragraph-annotation-methodsTemps passé, α de Krippendorff par schéma, κ de Cohen moyen par paires, le tout cité
table-distribution-<scheme>Un tableau booktabs de distribution des étiquettes par schéma, avec les totaux
table-annotatorsÉléments, étiquettes et temps médian par élément pour chaque annotateur
table-agreementα, κ moyen et interprétation par schéma face aux seuils 0.667 et 0.8 de Krippendorff
paragraph-limitationsRéserves chiffrées : unités annotées une seule fois, schémas à α faible, petits groupes d'annotateurs

Options en ligne de commande

OptionPar défautDescription
-o, --output-dirpaper_exportOù écrire le rapport
--no-anonymizedésactivéConserve les vrais noms d'utilisateur ; par défaut les annotateurs deviennent A1..An

Notes méthodologiques

  • Le mode article lit directement {output_annotation_dir}/<user>/user_state.json, résolu par rapport au fichier de configuration, et fonctionne donc sur des projets archivés sans démarrer de serveur.
  • L'α de Krippendorff (nominal) est calculé avec simpledorff, la même implémentation que le tableau de bord d'administration, sur les unités comptant au moins deux annotations. Le κ de Cohen par paires est calculé pour chaque paire d'annotateurs ayant au moins deux éléments en commun.
  • Les schémas catégoriels (radio, likert, multiselect, select, bws) donnent lieu à des distributions et à un accord. Pour multiselect, l'accord traite chaque case (élément, étiquette) comme une unité codée en binaire. Les schémas span et texte libre sont indiqués comme non couverts.
  • Les temps proviennent des journaux de comportement, à partir de total_time_ms, avec repli sur les intervalles entre horodatages d'interaction, les trous de plus d'une heure étant ignorés.

Pour aller plus loin