Mode article
Transformez un projet d'annotation en rapport de jeu de données LaTeX compilable, en une seule commande. Distributions d'étiquettes, statistiques d'accord avec les bonnes citations, tableaux d'annotateurs, temps passé et limites.
Nouveau dans la v2.7.0
Tous les articles de jeu de données se terminent de la même façon : reconstituer le nombre d'annotateurs, les statistiques d'accord, les distributions d'étiquettes et les temps à partir de fichiers de sortie éparpillés, puis les mettre en forme à la main en LaTeX. Le mode article le fait en une commande.
python -m potato.paper config.yaml -o paper_export
La sortie fonctionne entièrement hors ligne. Aucun LLM, aucun serveur, aucun réseau.
paper_export/
├── paper.tex # compilable standalone; every section cut-paste-able
├── paper.bib # citations for every metric used (+ Potato)
├── tables/*.csv # each table as CSV, for your own styling
└── summary.json # every computed number, machine-readable
paper.tex compile tel quel, et chaque paragraphe et chaque tableau se trouvent entre des marqueurs, ce qui vous permet de reprendre des sections entières dans un manuscrit :
%% === BLOCK: paragraph-annotation-methods ===
Annotators spent a median of 42 seconds per item (12.3 person-hours in total).
Inter-annotator agreement for \emph{politeness}, measured by Krippendorff's
$\alpha$ (nominal) \citep{krippendorff2004content} over the 214
multiply-annotated units, was $\alpha = 0.712$ (tentative agreement). ...
%% === END BLOCK: paragraph-annotation-methods ===Ce qu'il génère
| Bloc | Contenu |
|---|---|
paragraph-dataset-description | Nombre d'éléments, schémas, étiquettes, totaux d'annotateurs et d'étiquettes, prêts pour une section Données |
paragraph-annotation-methods | Temps passé, α de Krippendorff par schéma, κ de Cohen moyen par paires, le tout cité |
table-distribution-<scheme> | Un tableau booktabs de distribution des étiquettes par schéma, avec les totaux |
table-annotators | Éléments, étiquettes et temps médian par élément pour chaque annotateur |
table-agreement | α, κ moyen et interprétation par schéma face aux seuils 0.667 et 0.8 de Krippendorff |
paragraph-limitations | Réserves chiffrées : unités annotées une seule fois, schémas à α faible, petits groupes d'annotateurs |
Options en ligne de commande
| Option | Par défaut | Description |
|---|---|---|
-o, --output-dir | paper_export | Où écrire le rapport |
--no-anonymize | désactivé | Conserve les vrais noms d'utilisateur ; par défaut les annotateurs deviennent A1..An |
Notes méthodologiques
- Le mode article lit directement
{output_annotation_dir}/<user>/user_state.json, résolu par rapport au fichier de configuration, et fonctionne donc sur des projets archivés sans démarrer de serveur. - L'α de Krippendorff (nominal) est calculé avec
simpledorff, la même implémentation que le tableau de bord d'administration, sur les unités comptant au moins deux annotations. Le κ de Cohen par paires est calculé pour chaque paire d'annotateurs ayant au moins deux éléments en commun. - Les schémas catégoriels (
radio,likert,multiselect,select,bws) donnent lieu à des distributions et à un accord. Pour multiselect, l'accord traite chaque case (élément, étiquette) comme une unité codée en binaire. Les schémas span et texte libre sont indiqués comme non couverts. - Les temps proviennent des journaux de comportement, à partir de
total_time_ms, avec repli sur les intervalles entre horodatages d'interaction, les trous de plus d'une heure étant ignorés.
Pour aller plus loin
- Documenter les jeux de données d'annotation
- Accord inter-annotateurs
- Tableau de bord d'administration — les équivalents en direct de ces chiffres
- Documentation source