Skip to content

论文模式

一条命令把标注项目变成可直接编译的 LaTeX 数据集报告:标签分布、带正确引用的一致性统计、标注者表格、耗时数据和局限性说明。

v2.7.0 新增

每篇数据集论文的收尾都一样:从散落的输出文件里重新拼出标注者人数、一致性统计、标签分布和耗时,再手工排成 LaTeX。论文模式(Paper Mode)一条命令就做完。

bash
python -m potato.paper config.yaml -o paper_export

一条命令把项目变成可编译的 LaTeX 数据集报告,连方法一节都写好了。

输出完全离线。不用 LLM,不用服务器,不联网。

text
paper_export/
├── paper.tex        # compilable standalone; every section cut-paste-able
├── paper.bib        # citations for every metric used (+ Potato)
├── tables/*.csv     # each table as CSV, for your own styling
└── summary.json     # every computed number, machine-readable

paper.tex 可以直接编译,每个段落和表格都夹在标记之间,方便你把整节内容搬进稿件:

latex
%% === BLOCK: paragraph-annotation-methods ===
Annotators spent a median of 42 seconds per item (12.3 person-hours in total).
Inter-annotator agreement for \emph{politeness}, measured by Krippendorff's
$\alpha$ (nominal) \citep{krippendorff2004content} over the 214
multiply-annotated units, was $\alpha = 0.712$ (tentative agreement). ...
%% === END BLOCK: paragraph-annotation-methods ===

它会生成什么

区块内容
paragraph-dataset-description条目数量、方案、标签、标注者与标签总数,可直接用作 Data 一节
paragraph-annotation-methods耗时、每个方案的 Krippendorff's α、平均成对 Cohen's κ,全部带引用
table-distribution-<scheme>每个方案一张 booktabs 标签分布表,含合计
table-annotators每个标注者的条目数、标签数和每条目耗时中位数
table-agreement每个方案的 α、平均 κ,以及对照 Krippendorff 的 0.667 和 0.8 阈值给出的解读
paragraph-limitations带真实数字的注意事项:单人标注的单元、α 偏低的方案、标注者人数过少

CLI 选项

参数默认值说明
-o, --output-dirpaper_export报告写到哪里
--no-anonymize关闭保留真实用户名;默认标注者会变成 A1..An

方法说明

  • 论文模式直接读取 {output_annotation_dir}/<user>/user_state.json,路径相对配置文件解析,因此不启动服务器也能处理已归档的项目。
  • Krippendorff's α(名义型)用 simpledorff 计算,与管理仪表板是同一套实现,统计范围是标注数不少于两次的单元。成对 Cohen's κ 按标注者两两计算,要求该组合有不少于两个共同条目。
  • 分类型方案(radiolikertmultiselectselectbws)会给出分布和一致性。多选方案的一致性把每个 (条目, 标签) 复选框当作一个二值编码单元。片段和文本框方案会被列为不支持。
  • 耗时数据来自行为追踪,取 total_time_ms,没有时回退到交互时间戳的跨度,并忽略超过一小时的间隔。

延伸阅读