匯出標註資料用於機器學習
如何將 Potato 標註匯出為適合機器學習的格式,JSON/JSONL、CoNLL、Hugging Face Datasets、COCO 和 YOLO,以及各自的用途。
標註的目的通常是訓練或評估模型,因此匯出格式很重要。Potato 既能寫出普通的 JSON/JSONL/CSV,也能寫出訓練流程可直接讀取的機器學習原生格式,無需額外的銜接程式碼。 在標註之前先確定目標格式,能幫你想清楚如何組織資料和 ID。
參考資料請見匯出格式。
按任務挑選格式
| 格式 | 適用場景 |
|---|---|
| JSON / JSONL | 通用格式;每個條目一條記錄。最穩妥的預設選項。 |
| CSV | 電子表格,以及對分類標籤的快速分析。 |
| CoNLL | 詞元級別的序列標註(NER、組塊分析),使用 BIO 標籤。 |
| Hugging Face Datasets | 直接載入到 transformers 進行訓練。 |
| spaCy(經由 CoNLL) | 訓練 spaCy 的 NER 模型。先匯出 CoNLL,再執行 spacy convert。 |
| COCO / YOLO | 基於影像標註的目標檢測與分割。 |
| Parquet | 大規模列式儲存與分析。參見 Parquet 匯出。 |
設定輸出格式
yaml
output_annotation_dir: "annotation_output/"
output_annotation_format: "jsonl" # json, csv, conll, ...匯出中包含哪些內容
一條典型記錄包含條目 ID、原始內容、每位標註者的標籤,以及後設資料(誰、何時)。保留所有標註者的標籤而非僅保留聚合結果,可以讓你計算一致性,並在日後用不同方法重新聚合。
標註前先規劃匯出
匯出格式會約束你的輸入設計。序列標註的匯出需要一致的分詞;COCO/YOLO 需要影像尺寸;Hugging Face 需要穩定的標籤集。先確定目標格式,就不必重跑整個研究。參見為標註設計資料格式。