什麼是資料標註?
用通俗語言介紹資料標註:它是什麼、主要任務類型(分類、跨度標註、排序、自由文本),以及如何用 Potato 開展一個標註項目。
資料標註是為原始資料——文本、影像、音訊、影片或模型輸出——附加標籤的過程,從而使資料可以被度量、比較,或用於訓練和評估機器學習模型。 一個標籤可以是一條推文的情感類別、句子中被高亮的人名、對聊天機器人回覆的 1–5 品質評分,或照片中圈出行人的邊界框。
標註有時也稱為資料標記、打標籤,或編碼(社會科學中使用的術語)。參見維基百科上的資料標註以及相關概念帶標籤的訓練集。
它為何重要
有監督機器學習從已經帶有正確答案的樣例中學習。這些答案的品質為模型品質設定了上限,因此細緻的標註往往是一個項目中最具槓桿效應的環節。標註也是你評估模型的方式:要判斷一個 AI 系統是否正確,通常需要由人來評判它的輸出。
主要的標註任務類型
大多數項目可歸入少數幾類。每一類都對應 Potato 中的一種或多種標註控制元件(參見標註方案)。
- 分類:為整個條目選擇一個或多個類別。示例:這條評論是正面、負面還是中性?參見文本分類。
- 跨度標註:標記條目內部的某個區域,例如句子中的人名或音訊片段中的某一段。參見跨度標註。
- 評分與打分:把條目放到某個量表上,例如 1–5 的品質判斷。參見評分量表。
- 排序與比較:對條目排序,或從兩者中選出更好的一個。參見成對比較與最佳-最差量表。
- 結構化標註:將跨度連線成關係、構建共指鏈,或標註事件。參見關係與事件抽取。
- 自由文本:撰寫解釋、更正或轉寫。
一個最小示例
Potato 中的情感任務只需幾行 YAML。annotation_schemes 塊定義了標註者看到的標籤:
yaml
annotation_schemes:
- annotation_type: radio
name: sentiment
description: "What is the overall sentiment of this review?"
labels:
- Positive
- Negative
- Neutral這就是全部的介面定義。你提供資料,執行 potato start,標註者便可在瀏覽器中進行標註。
一個項目通常如何推進
- 定義任務。 寫下問題和標籤集合。
- 撰寫指南。 給標註者規則和示例。參見撰寫標註指南。
- 試標。 標註一小批資料,發現分歧,完善指南。
- 帶重疊地標註。 讓多人標註相同的條目,以便測量一致性。
- 測量一致性。 參見標註者間一致性。
- 裁定並匯出。 解決分歧,並匯出用於訓練或分析。