Skip to content

資料標註概念

查詢有關 Potato 的常見問題解答。沒有找到您需要的答案?請加入我們的 Discord 或查閱文件。

資料標註概念

資料標註是為原始資料(如文本、影像、音訊、影片或模型輸出)新增標籤的過程,使這些資料可用於訓練或評估機器學習模型。標籤可以是一個類別、一段高亮文本、一個評分或一次對比。Potato 讓你只需一份簡短的 YAML 配置,就能搭建上述任意一種任務類型。

標註者間一致性衡量的是相互獨立的標註者對同一條資料給出相同標籤的頻率。它是判斷任務定義是否清晰、標籤是否可靠的標準依據。常用的指標有 Cohen's kappa、Fleiss' kappa 和 Krippendorff's alpha,它們都會對偶然達成的一致進行校正。Potato 會在其管理後臺中報告 Krippendorff's alpha。

這取決於你的資料和目標,因此並沒有唯一的答案。如果你的工作橫跨文本、影像、音訊以及 AI 智慧體評估,那麼 Potato 是一個出色的免費開源選擇,它提供 60 多種任務類型和零程式碼的 YAML 配置方式。Label Studio、Doccano、brat 和 Argilla 也是各具特長的開源選擇。

首先定義任務和標籤集,然後編寫清晰的標註規範,並讓多名標註者對相互重疊的資料進行標註。衡量一致性、解決分歧,再以訓練流程能夠讀取的格式匯出結果。Potato 覆蓋了整個工作流程,並可匯出為 JSON、CoNLL、Hugging Face 以及 COCO/YOLO 格式。

清晰、客觀的任務通常只需一名標註者,再加上一小部分重疊樣本用於品質檢查即可。中等主觀程度的任務通常採用三名標註者,並以多數投票來裁定。高度主觀的任務則使用五名或更多標註者,有時還會保留全部意見,而不是歸併為單一答案。超過三名標註者後,收益會迅速遞減。

主動學習會挑選接下來要標註的資料,使模型用比隨機抽樣更少的標籤就能達到目標準確率。模型會標記出它認為資訊量最大的資料,通常是它最不確定的那些,然後由人來標註它們。Potato 支援不確定性、多樣性、BADGE 和 BALD 等策略。

分類是為整條資料賦予一個或多個標籤,例如把一條評論標記為正面或負面。片段標註則標記資料內部的某個區域,例如高亮句子中的人名,或音訊波形中的某個事件。命名實體識別和錯誤標記都屬於片段任務。Potato 同時支援這兩種方式,而且你可以在同一個介面上將它們組合使用。

讓人來評判這些輸出:在量表上打分、並排比較兩個結果、對照評分細則打分,或用片段標記出具體的錯誤。對於需要多步操作的智慧體,你還可以評判其執行軌跡中的每一步。Potato 提供了上述所有方式,並能讀取 OpenAI、Anthropic 和 ReAct 等格式的智慧體軌跡。

還有其他問題?

我們的社群隨時為您提供幫助。加入 Discord 獲取即時支援,或瀏覽文件獲取詳細指南。