Skip to content

論文模式

一條命令把標註項目變成可直接編譯的 LaTeX 資料集報告:標籤分佈、帶正確引用的一致性統計、標註者表格、耗時資料和侷限性說明。

v2.7.0 新增

每篇資料集論文的收尾都一樣:從散落的輸出檔案裡重新拼出標註者人數、一致性統計、標籤分佈和耗時,再手工排成 LaTeX。論文模式(Paper Mode)一條命令就做完。

bash
python -m potato.paper config.yaml -o paper_export

一條命令把項目變成可編譯的 LaTeX 資料集報告,連方法一節都寫好了。

輸出完全離線。不用 LLM,不用伺服器,不聯網。

text
paper_export/
├── paper.tex        # compilable standalone; every section cut-paste-able
├── paper.bib        # citations for every metric used (+ Potato)
├── tables/*.csv     # each table as CSV, for your own styling
└── summary.json     # every computed number, machine-readable

paper.tex 可以直接編譯,每個段落和表格都夾在標記之間,方便你把整節內容搬進稿件:

latex
%% === BLOCK: paragraph-annotation-methods ===
Annotators spent a median of 42 seconds per item (12.3 person-hours in total).
Inter-annotator agreement for \emph{politeness}, measured by Krippendorff's
$\alpha$ (nominal) \citep{krippendorff2004content} over the 214
multiply-annotated units, was $\alpha = 0.712$ (tentative agreement). ...
%% === END BLOCK: paragraph-annotation-methods ===

它會生成什麼

區塊內容
paragraph-dataset-description條目數量、方案、標籤、標註者與標籤總數,可直接用作 Data 一節
paragraph-annotation-methods耗時、每個方案的 Krippendorff's α、平均成對 Cohen's κ,全部帶引用
table-distribution-<scheme>每個方案一張 booktabs 標籤分佈表,含合計
table-annotators每個標註者的條目數、標籤數和每條目耗時中位數
table-agreement每個方案的 α、平均 κ,以及對照 Krippendorff 的 0.667 和 0.8 閾值給出的解讀
paragraph-limitations帶真實數字的注意事項:單人標註的單元、α 偏低的方案、標註者人數過少

CLI 選項

參數預設值說明
-o, --output-dirpaper_export報告寫到哪裡
--no-anonymize關閉保留真實使用者名稱;預設標註者會變成 A1..An

方法說明

  • 論文模式直接讀取 {output_annotation_dir}/<user>/user_state.json,路徑相對配置檔案解析,因此不啟動伺服器也能處理已歸檔的項目。
  • Krippendorff's α(名義型)用 simpledorff 計算,與管理儀表板是同一套實現,統計範圍是標註數不少於兩次的單元。成對 Cohen's κ 按標註者兩兩計算,要求該組合有不少於兩個共同條目。
  • 分類型方案(radiolikertmultiselectselectbws)會給出分佈和一致性。多選方案的一致性把每個 (條目, 標籤) 核取方塊當作一個二值編碼單元。片段和文本框方案會被列為不支援。
  • 耗時資料來自行為追蹤,取 total_time_ms,沒有時回退到互動時間戳的跨度,並忽略超過一小時的間隔。

延伸閱讀