論文模式
一條命令把標註項目變成可直接編譯的 LaTeX 資料集報告:標籤分佈、帶正確引用的一致性統計、標註者表格、耗時資料和侷限性說明。
v2.7.0 新增
每篇資料集論文的收尾都一樣:從散落的輸出檔案裡重新拼出標註者人數、一致性統計、標籤分佈和耗時,再手工排成 LaTeX。論文模式(Paper Mode)一條命令就做完。
bash
python -m potato.paper config.yaml -o paper_export
輸出完全離線。不用 LLM,不用伺服器,不聯網。
text
paper_export/
├── paper.tex # compilable standalone; every section cut-paste-able
├── paper.bib # citations for every metric used (+ Potato)
├── tables/*.csv # each table as CSV, for your own styling
└── summary.json # every computed number, machine-readable
paper.tex 可以直接編譯,每個段落和表格都夾在標記之間,方便你把整節內容搬進稿件:
latex
%% === BLOCK: paragraph-annotation-methods ===
Annotators spent a median of 42 seconds per item (12.3 person-hours in total).
Inter-annotator agreement for \emph{politeness}, measured by Krippendorff's
$\alpha$ (nominal) \citep{krippendorff2004content} over the 214
multiply-annotated units, was $\alpha = 0.712$ (tentative agreement). ...
%% === END BLOCK: paragraph-annotation-methods ===它會生成什麼
| 區塊 | 內容 |
|---|---|
paragraph-dataset-description | 條目數量、方案、標籤、標註者與標籤總數,可直接用作 Data 一節 |
paragraph-annotation-methods | 耗時、每個方案的 Krippendorff's α、平均成對 Cohen's κ,全部帶引用 |
table-distribution-<scheme> | 每個方案一張 booktabs 標籤分佈表,含合計 |
table-annotators | 每個標註者的條目數、標籤數和每條目耗時中位數 |
table-agreement | 每個方案的 α、平均 κ,以及對照 Krippendorff 的 0.667 和 0.8 閾值給出的解讀 |
paragraph-limitations | 帶真實數字的注意事項:單人標註的單元、α 偏低的方案、標註者人數過少 |
CLI 選項
| 參數 | 預設值 | 說明 |
|---|---|---|
-o, --output-dir | paper_export | 報告寫到哪裡 |
--no-anonymize | 關閉 | 保留真實使用者名稱;預設標註者會變成 A1..An |
方法說明
- 論文模式直接讀取
{output_annotation_dir}/<user>/user_state.json,路徑相對配置檔案解析,因此不啟動伺服器也能處理已歸檔的項目。 - Krippendorff's α(名義型)用
simpledorff計算,與管理儀表板是同一套實現,統計範圍是標註數不少於兩次的單元。成對 Cohen's κ 按標註者兩兩計算,要求該組合有不少於兩個共同條目。 - 分類型方案(
radio、likert、multiselect、select、bws)會給出分佈和一致性。多選方案的一致性把每個 (條目, 標籤) 核取方塊當作一個二值編碼單元。片段和文本框方案會被列為不支援。 - 耗時資料來自行為追蹤,取
total_time_ms,沒有時回退到互動時間戳的跨度,並忽略超過一小時的間隔。