Skip to content

匯出標註資料用於機器學習

如何將 Potato 標註匯出為適合機器學習的格式,JSON/JSONL、CoNLL、Hugging Face Datasets、COCO 和 YOLO,以及各自的用途。

標註的目的通常是訓練或評估模型,因此匯出格式很重要。Potato 既能寫出普通的 JSON/JSONL/CSV,也能寫出訓練流程可直接讀取的機器學習原生格式,無需額外的銜接程式碼。 在標註之前先確定目標格式,能幫你想清楚如何組織資料和 ID。

參考資料請見匯出格式

按任務挑選格式

格式適用場景
JSON / JSONL通用格式;每個條目一條記錄。最穩妥的預設選項。
CSV電子表格,以及對分類標籤的快速分析。
CoNLL詞元級別的序列標註(NER、組塊分析),使用 BIO 標籤
Hugging Face Datasets直接載入到 transformers 進行訓練。
spaCy(經由 CoNLL)訓練 spaCy 的 NER 模型。先匯出 CoNLL,再執行 spacy convert
COCO / YOLO基於影像標註的目標檢測與分割。
Parquet大規模列式儲存與分析。參見 Parquet 匯出

設定輸出格式

yaml
output_annotation_dir: "annotation_output/"
output_annotation_format: "jsonl"   # json, csv, conll, ...

匯出中包含哪些內容

一條典型記錄包含條目 ID、原始內容、每位標註者的標籤,以及後設資料(誰、何時)。保留所有標註者的標籤而非僅保留聚合結果,可以讓你計算一致性,並在日後用不同方法重新聚合。

標註前先規劃匯出

匯出格式會約束你的輸入設計。序列標註的匯出需要一致的分詞;COCO/YOLO 需要影像尺寸;Hugging Face 需要穩定的標籤集。先確定目標格式,就不必重跑整個研究。參見為標註設計資料格式

延伸閱讀