Skip to content

Modo artículo

Convierte un proyecto de anotación en un informe de dataset en LaTeX compilable con un solo comando. Distribuciones de etiquetas, estadísticas de acuerdo con las citas correctas, tablas de anotadores, tiempos y limitaciones.

Nuevo en v2.7.0

Todos los artículos de dataset acaban igual: reconstruyendo recuentos de anotadores, estadísticas de acuerdo, distribuciones de etiquetas y tiempos a partir de archivos de salida dispersos, y luego dándoles formato LaTeX a mano. El modo artículo lo hace con un solo comando.

bash
python -m potato.paper config.yaml -o paper_export

Un comando convierte el proyecto en un informe de dataset en LaTeX compilable, sección de métodos incluida.

La salida funciona totalmente sin conexión. Sin LLM, sin servidor y sin red.

text
paper_export/
├── paper.tex        # compilable standalone; every section cut-paste-able
├── paper.bib        # citations for every metric used (+ Potato)
├── tables/*.csv     # each table as CSV, for your own styling
└── summary.json     # every computed number, machine-readable

paper.tex compila tal cual, y cada párrafo y cada tabla quedan entre marcadores para que puedas llevarte secciones enteras a un manuscrito:

latex
%% === BLOCK: paragraph-annotation-methods ===
Annotators spent a median of 42 seconds per item (12.3 person-hours in total).
Inter-annotator agreement for \emph{politeness}, measured by Krippendorff's
$\alpha$ (nominal) \citep{krippendorff2004content} over the 214
multiply-annotated units, was $\alpha = 0.712$ (tentative agreement). ...
%% === END BLOCK: paragraph-annotation-methods ===

Qué genera

BloqueContenido
paragraph-dataset-descriptionRecuentos de elementos, esquemas, etiquetas, totales de anotadores y de etiquetas, listo para una sección de datos
paragraph-annotation-methodsTiempos, α de Krippendorff por esquema, κ de Cohen media por pares, todo citado
table-distribution-<scheme>Una tabla booktabs de distribución de etiquetas por esquema, con totales
table-annotatorsElementos, etiquetas y mediana de segundos por elemento de cada anotador
table-agreementα, κ media e interpretación por esquema frente a los umbrales 0.667 y 0.8 de Krippendorff
paragraph-limitationsSalvedades con números reales: unidades con una sola anotación, esquemas con α baja, grupos pequeños de anotadores

Opciones de línea de comandos

OpciónPor defectoDescripción
-o, --output-dirpaper_exportDónde escribir el informe
--no-anonymizedesactivadoConserva los nombres de usuario reales; por defecto los anotadores pasan a ser A1..An

Notas metodológicas

  • El modo artículo lee directamente {output_annotation_dir}/<user>/user_state.json, resuelto en relación con el archivo de configuración, así que funciona sobre proyectos archivados sin arrancar ningún servidor.
  • El α de Krippendorff (nominal) se calcula con simpledorff, la misma implementación que usa el panel de administración, sobre las unidades con dos o más anotaciones. La κ de Cohen por pares se calcula para cada pareja de anotadores con dos o más elementos en común.
  • Los esquemas categóricos (radio, likert, multiselect, select, bws) obtienen distribuciones y acuerdo. En multiselect, el acuerdo trata cada casilla (elemento, etiqueta) como una unidad codificada en binario. Los esquemas de span y de texto libre aparecen como no cubiertos.
  • Los tiempos salen de los registros de comportamiento, usando total_time_ms y recurriendo a los intervalos entre marcas de tiempo de interacción, con los huecos de más de una hora descartados.

Lecturas adicionales