Skip to content

专家标注与众包标注

众包标注者何时能与专家持平、每个条目需要多少人、两种做法各自的成本,以及如何对标注者的能力建模而不是依赖多数投票。

当一位认真遵循你指南的非专业人士会得出与专家相同的判断时,就用众包标注者,并且每个条目收集多份判断而不是一份。Snow et al. (2008) 发现,在五项自然语言任务上,平均四份非专家标注可以达到一位专家标注者的一致度。

专家与众包之间的取舍通常被说成质量和成本的权衡,而对多数任务来说这个框架是错的。真正的问题是:这个判断是否依赖于众包所不具备的训练。情感、文本蕴含和词语相似度大多不依赖。临床编码、法律分类和语音转写大多依赖。

证据支持什么

奠基性的结果来自 Snow et al. (2008)。他们在情绪识别、词语相似度、文本蕴含识别、事件时间排序和词义消歧上,把来自 Amazon Mechanical Turk 的非专家标注与专家金标准做了比较。把各项任务汇总后,他们报告说"每个样例只需要 4 份非专家标注,就能达到与一位专家标注者等同的 ITA"("it requires only 4 non-expert annotations per example to achieve the equivalent ITA as a single expert annotator")。在成本上他们给的是单价而不是比例:用两美元收集了 7,000 份情绪标注,并把它描述为"每美元至少 875 个专家等效标签"("at least 875 expert-equivalent labels per USD")。

这个平均值内部的任务间差异比平均值本身更重要。在他们的情绪任务中,愤怒、厌恶和悲伤用两位非专家就达到了专家水平,惊讶需要九位,而恐惧在他们收集的十位标注者之内始终没有达到。任务层面的平均值会掩盖那些众包无法替代训练的标签。

Callison-Burch (2009) 在机器翻译评测中发现了同样的规律:他用十美元重现了 WMT08 的评判,并报告说合并后的非专家评判"与专家评判的相关性强于 Bleu"("correlate more strongly with expert judgments than Bleu does")。

另一头的分量是:专家有时更快。Alfter et al. (2022) 让第二语言使用者、语言专业人士和 CEFR 专家对多词表达做了一项 best-worst scaling 任务。三组的排序高度相关,质量相当,但专家直接标注每个项目花了 15 到 90 分钟,而众包版本大约要八到九小时,他们把这描述为"至少快五倍"("at least five times as fast")。如果手头已经有少量专家,把工作转给众包反而可能比省下的时间花得更多。

起作用的是冗余,不是众包

在上述每一项研究里,单份众包判断都不如单份专家判断。弥合差距的是每个条目收集多份判断并加以合并,所以设计上的问题是怎么合并。

多数投票把每位标注者都当作同样可靠,而他们并不是。有两个模型改为从数据中估计可靠度。Dawid and Skene (1979) 提出了一种期望最大化过程,为每位观察者估计一个混淆矩阵,同时估计潜在的真实标签,最初用于临床观察者误差。MACE,即 Multi-Annotator Competence Estimation,是为众包场景构建的项目反应模型,它无需监督就能学出哪些标注者值得信任,并预测底层标签。作者们做这个模型,是因为"有些标注者为了让报酬最大化而选择糟糕的标签"("some annotators choose bad labels in order to maximize their pay"),而当足够多的标注者都这么做时,多数投票会不声不响地把这种故障吸收进去。

Potato 两者都提供。mace 块会在已收集的标注上运行能力估计,Dawid-Skene 计算器则对你粘贴的标签运行这个估计器。

yaml
mace:
  enabled: true
 
num_annotators_per_item: 4
 
gold_standards:
  enabled: true
 
attention_checks:
  enabled: true

num_annotators_per_item: 4 依据的是 Snow et al. 的结果,而不是某个内部默认值;它是应当逐任务重新审视的值,不是跨项目沿用的值。金标准和注意力检查能抓出没在认真读的标注者,而能力模型在有若干锚定条目可供校准时表现更好。

分歧不自动等于错误

把每一处分歧都当成质量问题,会导致错误的干预。Plank et al. (2014) 分析了词性标注中的标注者分歧,发现"只有 2% 的标注者选择在语言学上没有依据"("only 2% of annotator choices are linguistically unmotivated"),并由此得出结论:多数分歧来自语言学上可争议的情形,而不是来自错误。

Pavlick and Kwiatkowski (2019) 检验了自然语言推理中的分歧是否会随数据增加而消失,结果是不会。他们报告说这些分歧"不能被当作标注'噪声'而弃置不顾,相反,无论我们收集更多评分,还是改变提供给评分者的上下文数量,它们都持续存在"("are not dismissible as annotation 'noise', but rather persist as we collect more ratings and as we vary the amount of context provided to raters")。Plank (2022) 把这一点概括为人类标签变异。

实际的检验很便宜。对标注者产生分歧的那些条目多收集一些判断。如果一致度收敛,说明分歧是噪声,冗余就能解决。如果始终不动,说明该条目确实含混,正确的做法是记录分布,而不是强行给出单一标签。

训练对一致度的影响大于标注者类型

Bayerl and Paul (2011) 对词义消歧、韵律转写和语音转写领域的 96 项标注研究做了元分析,覆盖 346 个一致度指标。有七个因素解释了一致度的变异,其中两个与训练有关,即标注者是否接受过训练,以及训练的强度如何。其余几个是标注领域、方案中的类别数量、标注者人数、标注目的,以及计算百分比一致度所用的方法。

这个结果重新界定了专家还是众包的决定。一位受过训练、使用类别不多且经过检验的方案的众包标注者,往往比一位没受过训练、使用含糊方案的专家一致度更高。对一致度而言,编写标注指南和选择标注方案比招募渠道更管用。

众包标注在哪里行不通

有三种情形会让众包成为错误的选择。判断需要有资质的知识,比如临床或法律编码,这时标错标签不只是带来噪声。数据不能离开你自己的基础设施,这就排除了公共众包平台,无论质量如何。标签集大到或层级深到让每位标注者的培训成本超过节省下来的开支,这在类别数大致超过几十个时很常见。

当第一种情形成立而数据量又很大时,混合设计通常胜过两个极端。专家标注一个子集,该子集成为金标准,众包标注者在进入真正的任务之前先用它来筛选。筛选的具体做法见金标准与注意力检查。

延伸阅读

参考文献

Snow, R., O'Connor, B., Jurafsky, D., and Ng, A. Y. (2008). Cheap and Fast – But is it Good? Evaluating Non-Expert Annotations for Natural Language Tasks. Proceedings of EMNLP 2008, 254-263. https://aclanthology.org/D08-1027/

Callison-Burch, C. (2009). Fast, Cheap, and Creative: Evaluating Translation Quality Using Amazon's Mechanical Turk. Proceedings of EMNLP 2009, 286-295. https://aclanthology.org/D09-1030/

Dawid, A. P., and Skene, A. M. (1979). Maximum Likelihood Estimation of Observer Error-Rates Using the EM Algorithm. Journal of the Royal Statistical Society. Series C (Applied Statistics), 28(1), 20-28. https://doi.org/10.2307/2346806

Hovy, D., Berg-Kirkpatrick, T., Vaswani, A., and Hovy, E. (2013). Learning Whom to Trust with MACE. Proceedings of NAACL-HLT 2013, 1120-1130. https://aclanthology.org/N13-1132/

Plank, B., Hovy, D., and Søgaard, A. (2014). Linguistically debatable or just plain wrong? Proceedings of ACL 2014 (Volume 2: Short Papers), 507-511. https://doi.org/10.3115/v1/P14-2083

Pavlick, E., and Kwiatkowski, T. (2019). Inherent Disagreements in Human Textual Inferences. Transactions of the Association for Computational Linguistics, 7, 677-694. https://aclanthology.org/Q19-1043/

Bayerl, P. S., and Paul, K. I. (2011). What Determines Inter-Coder Agreement in Manual Annotations? A Meta-Analytic Investigation. Computational Linguistics, 37(4), 699-725. https://doi.org/10.1162/COLI_a_00074

Alfter, D., Lindström Tiedemann, T., and Volodina, E. (2022). Crowdsourcing Relative Rankings of Multi-Word Expressions: Experts versus Non-Experts. Northern European Journal of Language Technology, 7(1). https://doi.org/10.3384/nejlt.2000-1533.2021.3128

Plank, B. (2022). The "Problem" of Human Label Variation: On Ground Truth in Data, Modeling and Evaluation. Proceedings of EMNLP 2022, 10671-10682. https://doi.org/10.18653/v1/2022.emnlp-main.731