裁定與分歧處理
當標註者出現分歧時該怎麼辦:裁定流程、按多數表決聚合,以及像 MACE 這樣按標註者能力加權的統計模型。
分歧是正常的,也是有價值的資訊。處理分歧意味著把多位標註者的標籤合併為一個可信的標籤,途徑包括專家稽核、聚合,或使用一個按標註者可靠程度加權的統計模型。 過早強求唯一答案,會丟掉關於哪些條目確實困難的訊號。
三種處理方式
-
多數表決。 簡單且透明:取出現最多的標籤。當標註者水平大致相當、任務清晰時效果很好,但它會把粗心的標註者和認真的標註者一視同仁。
-
專家裁定。 把有分歧的條目交給專家做最終判定。最準確,也最昂貴。把它用在那些重要、且聚合不可靠的條目上。
-
統計聚合。 像 MACE(多標註者能力估計)這樣的模型,會從標註者的一致模式中推斷各自的可靠程度,併產出一個加權的"最佳猜測"標籤,外加每位標註者的能力得分。它無需逐條人工核查就能自動降低亂標者的權重。可瞭解面向眾包標籤的潛變數模型這一基本思路。
一套實用流程
- 收集重疊標註(每個條目由多人標註)。
- 用多數表決或 MACE 聚合,得到一個草稿標籤,並標記出一致性低的條目。
- 只把被標記出的條目送去專家裁定。
- 把所學反饋回標註指南。
Potato 支援一種裁定流程:稽核者並排檢視所有標註者的標籤,並記錄下處理後的答案。
當分歧本身就是資料時
對於主觀任務,比如幽默、冒犯、情感,持續的分歧可能反映人與人之間真實的差異,而非錯誤。在這些情形下,可考慮保留完整的標籤分佈(有時稱為軟標籤或視角主義標註),而不是塌縮為單一答案。Potato 支援記錄分佈,而非強求達成共識。