專家標註與眾包標註
眾包標註者何時能與專家持平、每個條目需要多少人、兩種做法各自的成本,以及如何對標註者的能力建模而不是依賴多數投票。
當一位認真遵循你指南的非專業人士會得出與專家相同的判斷時,就用眾包標註者,並且每個條目收集多份判斷而不是一份。Snow et al. (2008) 發現,在五項自然語言任務上,平均四份非專家標註可以達到一位專家標註者的一致度。
專家與眾包之間的取捨通常被說成品質和成本的權衡,而對多數任務來說這個框架是錯的。真正的問題是:這個判斷是否依賴於眾包所不具備的訓練。情感、文本蘊含和詞語相似度大多不依賴。臨床編碼、法律分類和語音轉寫大多依賴。
證據支援什麼
奠基性的結果來自 Snow et al. (2008)。他們在情緒識別、詞語相似度、文本蘊含識別、事件時間排序和詞義消歧上,把來自 Amazon Mechanical Turk 的非專家標註與專家金標準做了比較。把各項任務彙總後,他們報告說"每個樣例只需要 4 份非專家標註,就能達到與一位專家標註者等同的 ITA"("it requires only 4 non-expert annotations per example to achieve the equivalent ITA as a single expert annotator")。在成本上他們給的是單價而不是比例:用兩美元收集了 7,000 份情緒標註,並把它描述為"每美元至少 875 個專家等效標籤"("at least 875 expert-equivalent labels per USD")。
這個平均值內部的任務間差異比平均值本身更重要。在他們的情緒任務中,憤怒、厭惡和悲傷用兩位非專家就達到了專家水平,驚訝需要九位,而恐懼在他們收集的十位標註者之內始終沒有達到。任務層面的平均值會掩蓋那些眾包無法替代訓練的標籤。
Callison-Burch (2009) 在機器翻譯評測中發現了同樣的規律:他用十美元重現了 WMT08 的評判,並報告說合並後的非專家評判"與專家評判的相關性強於 Bleu"("correlate more strongly with expert judgments than Bleu does")。
另一頭的分量是:專家有時更快。Alfter et al. (2022) 讓第二語言使用者、語言專業人士和 CEFR 專家對多詞表達做了一項 best-worst scaling 任務。三組的排序高度相關,品質相當,但專家直接標註每個項目花了 15 到 90 分鐘,而眾包版本大約要八到九小時,他們把這描述為"至少快五倍"("at least five times as fast")。如果手頭已經有少量專家,把工作轉給眾包反而可能比省下的時間花得更多。
起作用的是冗餘,不是眾包
在上述每一項研究裡,單份眾包判斷都不如單份專家判斷。彌合差距的是每個條目收集多份判斷並加以合併,所以設計上的問題是怎麼合併。
多數投票把每位標註者都當作同樣可靠,而他們並不是。有兩個模型改為從資料中估計可靠度。Dawid and Skene (1979) 提出了一種期望最大化過程,為每位觀察者估計一個混淆矩陣,同時估計潛在的真實標籤,最初用於臨床觀察者誤差。MACE,即 Multi-Annotator Competence Estimation,是為眾包場景構建的項目反應模型,它無需監督就能學出哪些標註者值得信任,並預測底層標籤。作者們做這個模型,是因為"有些標註者為了讓報酬最大化而選擇糟糕的標籤"("some annotators choose bad labels in order to maximize their pay"),而當足夠多的標註者都這麼做時,多數投票會不聲不響地把這種故障吸收進去。
Potato 兩者都提供。mace 塊會在已收集的標註上執行能力估計,Dawid-Skene 計算器則對你貼上的標籤執行這個估計器。
mace:
enabled: true
num_annotators_per_item: 4
gold_standards:
enabled: true
attention_checks:
enabled: truenum_annotators_per_item: 4 依據的是 Snow et al. 的結果,而不是某個內部預設值;它是應當逐任務重新審視的值,不是跨項目沿用的值。金標準和注意力檢查能抓出沒在認真讀的標註者,而能力模型在有若干錨定條目可供校準時表現更好。
分歧不自動等於錯誤
把每一處分歧都當成品質問題,會導致錯誤的干預。Plank et al. (2014) 分析了詞性標註中的標註者分歧,發現"只有 2% 的標註者選擇在語言學上沒有依據"("only 2% of annotator choices are linguistically unmotivated"),並由此得出結論:多數分歧來自語言學上可爭議的情形,而不是來自錯誤。
Pavlick and Kwiatkowski (2019) 檢驗了自然語言推理中的分歧是否會隨資料增加而消失,結果是不會。他們報告說這些分歧"不能被當作標註'噪聲'而棄置不顧,相反,無論我們收集更多評分,還是改變提供給評分者的上下文數量,它們都持續存在"("are not dismissible as annotation 'noise', but rather persist as we collect more ratings and as we vary the amount of context provided to raters")。Plank (2022) 把這一點概括為人類標籤變異。
實際的檢驗很便宜。對標註者產生分歧的那些條目多收集一些判斷。如果一致度收斂,說明分歧是噪聲,冗餘就能解決。如果始終不動,說明該條目確實含混,正確的做法是記錄分佈,而不是強行給出單一標籤。
訓練對一致度的影響大於標註者類型
Bayerl and Paul (2011) 對詞義消歧、韻律轉寫和語音轉寫領域的 96 項標註研究做了元分析,覆蓋 346 個一致度指標。有七個因素解釋了一致度的變異,其中兩個與訓練有關,即標註者是否接受過訓練,以及訓練的強度如何。其餘幾個是標註領域、方案中的類別數量、標註者人數、標註目的,以及計算百分比一致度所用的方法。
這個結果重新界定了專家還是眾包的決定。一位受過訓練、使用類別不多且經過檢驗的方案的眾包標註者,往往比一位沒受過訓練、使用含糊方案的專家一致度更高。對一致度而言,編寫標註指南和選擇標註方案比招募渠道更管用。
眾包標註在哪裡行不通
有三種情形會讓眾包成為錯誤的選擇。判斷需要有資質的知識,比如臨床或法律編碼,這時標錯標籤不只是帶來噪聲。資料不能離開你自己的基礎設施,這就排除了公共眾包平臺,無論品質如何。標籤集大到或層級深到讓每位標註者的培訓成本超過節省下來的開支,這在類別數大致超過幾十個時很常見。
當第一種情形成立而資料量又很大時,混合設計通常勝過兩個極端。專家標註一個子集,該子整合為金標準,眾包標註者在進入真正的任務之前先用它來篩選。篩選的具體做法見金標準與注意力檢查。
延伸閱讀
- 你需要多少位標註者?梳理了冗餘與統計效力。
- 聚合眾包標籤講的是判斷收集之後如何合併。
- 用 Prolific 和 MTurk 做眾包講招募與報酬。
- 標註者間一致度詳解講各個係數。
參考文獻
Snow, R., O'Connor, B., Jurafsky, D., and Ng, A. Y. (2008). Cheap and Fast – But is it Good? Evaluating Non-Expert Annotations for Natural Language Tasks. Proceedings of EMNLP 2008, 254-263. https://aclanthology.org/D08-1027/
Callison-Burch, C. (2009). Fast, Cheap, and Creative: Evaluating Translation Quality Using Amazon's Mechanical Turk. Proceedings of EMNLP 2009, 286-295. https://aclanthology.org/D09-1030/
Dawid, A. P., and Skene, A. M. (1979). Maximum Likelihood Estimation of Observer Error-Rates Using the EM Algorithm. Journal of the Royal Statistical Society. Series C (Applied Statistics), 28(1), 20-28. https://doi.org/10.2307/2346806
Hovy, D., Berg-Kirkpatrick, T., Vaswani, A., and Hovy, E. (2013). Learning Whom to Trust with MACE. Proceedings of NAACL-HLT 2013, 1120-1130. https://aclanthology.org/N13-1132/
Plank, B., Hovy, D., and Søgaard, A. (2014). Linguistically debatable or just plain wrong? Proceedings of ACL 2014 (Volume 2: Short Papers), 507-511. https://doi.org/10.3115/v1/P14-2083
Pavlick, E., and Kwiatkowski, T. (2019). Inherent Disagreements in Human Textual Inferences. Transactions of the Association for Computational Linguistics, 7, 677-694. https://aclanthology.org/Q19-1043/
Bayerl, P. S., and Paul, K. I. (2011). What Determines Inter-Coder Agreement in Manual Annotations? A Meta-Analytic Investigation. Computational Linguistics, 37(4), 699-725. https://doi.org/10.1162/COLI_a_00074
Alfter, D., Lindström Tiedemann, T., and Volodina, E. (2022). Crowdsourcing Relative Rankings of Multi-Word Expressions: Experts versus Non-Experts. Northern European Journal of Language Technology, 7(1). https://doi.org/10.3384/nejlt.2000-1533.2021.3128
Plank, B. (2022). The "Problem" of Human Label Variation: On Ground Truth in Data, Modeling and Evaluation. Proceedings of EMNLP 2022, 10671-10682. https://doi.org/10.18653/v1/2022.emnlp-main.731