Modo artículo
Convierte un proyecto de anotación en un informe de dataset en LaTeX compilable con un solo comando. Distribuciones de etiquetas, estadísticas de acuerdo con las citas correctas, tablas de anotadores, tiempos y limitaciones.
Nuevo en v2.7.0
Todos los artículos de dataset acaban igual: reconstruyendo recuentos de anotadores, estadísticas de acuerdo, distribuciones de etiquetas y tiempos a partir de archivos de salida dispersos, y luego dándoles formato LaTeX a mano. El modo artículo lo hace con un solo comando.
bash
python -m potato.paper config.yaml -o paper_export
La salida funciona totalmente sin conexión. Sin LLM, sin servidor y sin red.
text
paper_export/
├── paper.tex # compilable standalone; every section cut-paste-able
├── paper.bib # citations for every metric used (+ Potato)
├── tables/*.csv # each table as CSV, for your own styling
└── summary.json # every computed number, machine-readable
paper.tex compila tal cual, y cada párrafo y cada tabla quedan entre marcadores para que puedas llevarte secciones enteras a un manuscrito:
latex
%% === BLOCK: paragraph-annotation-methods ===
Annotators spent a median of 42 seconds per item (12.3 person-hours in total).
Inter-annotator agreement for \emph{politeness}, measured by Krippendorff's
$\alpha$ (nominal) \citep{krippendorff2004content} over the 214
multiply-annotated units, was $\alpha = 0.712$ (tentative agreement). ...
%% === END BLOCK: paragraph-annotation-methods ===Qué genera
| Bloque | Contenido |
|---|---|
paragraph-dataset-description | Recuentos de elementos, esquemas, etiquetas, totales de anotadores y de etiquetas, listo para una sección de datos |
paragraph-annotation-methods | Tiempos, α de Krippendorff por esquema, κ de Cohen media por pares, todo citado |
table-distribution-<scheme> | Una tabla booktabs de distribución de etiquetas por esquema, con totales |
table-annotators | Elementos, etiquetas y mediana de segundos por elemento de cada anotador |
table-agreement | α, κ media e interpretación por esquema frente a los umbrales 0.667 y 0.8 de Krippendorff |
paragraph-limitations | Salvedades con números reales: unidades con una sola anotación, esquemas con α baja, grupos pequeños de anotadores |
Opciones de línea de comandos
| Opción | Por defecto | Descripción |
|---|---|---|
-o, --output-dir | paper_export | Dónde escribir el informe |
--no-anonymize | desactivado | Conserva los nombres de usuario reales; por defecto los anotadores pasan a ser A1..An |
Notas metodológicas
- El modo artículo lee directamente
{output_annotation_dir}/<user>/user_state.json, resuelto en relación con el archivo de configuración, así que funciona sobre proyectos archivados sin arrancar ningún servidor. - El α de Krippendorff (nominal) se calcula con
simpledorff, la misma implementación que usa el panel de administración, sobre las unidades con dos o más anotaciones. La κ de Cohen por pares se calcula para cada pareja de anotadores con dos o más elementos en común. - Los esquemas categóricos (
radio,likert,multiselect,select,bws) obtienen distribuciones y acuerdo. En multiselect, el acuerdo trata cada casilla (elemento, etiqueta) como una unidad codificada en binario. Los esquemas de span y de texto libre aparecen como no cubiertos. - Los tiempos salen de los registros de comportamiento, usando
total_time_msy recurriendo a los intervalos entre marcas de tiempo de interacción, con los huecos de más de una hora descartados.
Lecturas adicionales
- Documentar conjuntos de datos de anotación
- La concordancia entre anotadores
- Panel de administración — los equivalentes en vivo de estos números
- Documentación de origen