Annotation par des experts ou par la foule
Quand les annotateurs non experts égalent les experts, combien il en faut par item, ce que coûte chaque approche, et comment modéliser la compétence des annotateurs plutôt que de se fier au vote majoritaire.
Utilisez des annotateurs de la foule quand une personne non spécialiste suivant soigneusement vos consignes parviendrait au même jugement qu'un spécialiste, et recueillez plusieurs jugements par item plutôt qu'un seul. Snow et al. (2008) ont trouvé qu'en moyenne quatre annotations non expertes égalaient l'accord d'un seul annotateur expert sur cinq tâches de langue naturelle.
Le choix entre annotateurs experts et annotateurs de la foule est le plus souvent présenté comme un arbitrage entre qualité et coût, ce qui est le mauvais cadrage pour la plupart des tâches. La question est de savoir si le jugement dépend d'une formation que la foule n'a pas. Le sentiment, l'inférence textuelle et la similarité lexicale n'en dépendent généralement pas. Le codage clinique, la classification juridique et la transcription phonétique en dépendent généralement.
Ce que les résultats établissent
Le résultat fondateur vient de Snow et al. (2008), qui ont comparé des annotations non expertes issues d'Amazon Mechanical Turk à des étalons-or produits par des experts, sur la reconnaissance de l'affect, la similarité lexicale, la reconnaissance de l'inférence textuelle, l'ordonnancement temporel d'événements et la désambiguïsation du sens des mots. Toutes tâches confondues, ils rapportent qu'"il ne faut que 4 annotations non expertes par exemple pour atteindre l'ITA équivalent à celui d'un seul annotateur expert" ("it requires only 4 non-expert annotations per example to achieve the equivalent ITA as a single expert annotator"). Pour le coût, ils donnent un taux et non un rapport : ils ont recueilli 7000 annotations d'affect pour deux dollars et décrivent cela comme "au moins 875 étiquettes équivalentes-expert par USD" ("at least 875 expert-equivalent labels per USD").
La variation d'une tâche à l'autre à l'intérieur de cette moyenne compte davantage que la moyenne. Dans leur tâche d'affect, la colère, le dégoût et la tristesse ont atteint le niveau expert avec deux non-experts, la surprise en a demandé neuf, et la peur ne l'a jamais atteint parmi les dix annotateurs recueillis. Une moyenne au niveau de la tâche masque les étiquettes pour lesquelles la foule ne peut pas remplacer la formation.
Callison-Burch (2009) a trouvé le même schéma pour l'évaluation de la traduction automatique : il a reconstitué les jugements de WMT08 pour dix dollars et rapporte que les jugements non experts combinés "corrèlent plus fortement avec les jugements experts que Bleu" ("correlate more strongly with expert judgments than Bleu does").
Le contrepoids, c'est que les experts sont parfois plus rapides. Alfter et al. (2022) ont mené une tâche de best-worst scaling sur des expressions polylexicales avec des locuteurs de langue seconde, des professionnels de la langue et des experts du CECRL. Les classements des trois groupes corrélaient fortement, donc la qualité était comparable, mais l'annotation directe par des experts a pris de 15 à 90 minutes par projet contre environ huit à neuf heures pour la version par la foule, ce qu'ils décrivent comme "au moins cinq fois plus rapide" ("at least five times as fast"). Là où un petit nombre de spécialistes est déjà disponible, confier le travail à une foule peut coûter plus de temps qu'il n'en fait gagner.
Le mécanisme, c'est la redondance, pas la foule
Un jugement isolé de la foule est moins bon qu'un jugement isolé d'expert dans toutes les études ci-dessus. Ce qui comble l'écart, c'est de recueillir plusieurs jugements par item et de les combiner ; la question de conception est donc comment les combiner.
Le vote majoritaire traite tous les annotateurs comme également fiables, ce qu'ils ne sont pas. Deux modèles estiment la fiabilité à partir des données. Dawid and Skene (1979) ont introduit une procédure d'espérance-maximisation qui estime une matrice de confusion par observateur en même temps que les étiquettes vraies latentes, à l'origine pour l'erreur d'observateurs cliniques. MACE, pour Multi-Annotator Competence Estimation, est un modèle de réponse à l'item conçu pour le cas du crowdsourcing, qui apprend sans supervision quels annotateurs sont dignes de confiance et prédit les étiquettes sous-jacentes. Ses auteurs l'ont construit parce que "certains annotateurs choisissent de mauvaises étiquettes afin de maximiser leur rémunération" ("some annotators choose bad labels in order to maximize their pay"), un mode de défaillance que le vote majoritaire absorbe silencieusement quand assez d'annotateurs le partagent.
Potato fournit les deux. Un bloc mace lance l'estimation de compétence sur les annotations recueillies, et le calculateur Dawid-Skene applique l'estimateur aux étiquettes que vous collez.
mace:
enabled: true
num_annotators_per_item: 4
gold_standards:
enabled: true
attention_checks:
enabled: truenum_annotators_per_item: 4 suit le résultat de Snow et al. et non une valeur par défaut maison, et c'est la valeur à réexaminer tâche par tâche plutôt qu'à transporter d'un projet à l'autre. Les étalons-or et les contrôles d'attention repèrent l'annotateur qui ne lit pas, ce que les modèles de compétence gèrent mieux lorsqu'ils disposent de quelques items ancrés pour se calibrer.
Le désaccord n'est pas automatiquement une erreur
Traiter tout désaccord comme un problème de qualité conduit à la mauvaise intervention. Plank et al. (2014) ont analysé les désaccords entre annotateurs dans l'annotation en parties du discours et ont trouvé que "seulement 2% des choix des annotateurs sont linguistiquement non motivés" ("only 2% of annotator choices are linguistically unmotivated"), concluant que la majorité des désaccords viennent de cas linguistiquement discutables plutôt que d'erreurs.
Pavlick and Kwiatkowski (2019) ont testé si le désaccord en inférence en langue naturelle disparaît avec davantage de données : il ne disparaît pas. Ils rapportent que les désaccords "ne peuvent être écartés comme du 'bruit' d'annotation, mais persistent à mesure que nous recueillons plus d'évaluations et que nous faisons varier la quantité de contexte fournie aux évaluateurs" ("are not dismissible as annotation 'noise', but rather persist as we collect more ratings and as we vary the amount of context provided to raters"). Plank (2022) généralise le point sous le nom de variation humaine des étiquettes.
Le test pratique ne coûte rien. Recueillez plus de jugements sur les items où les annotateurs divergent. Si l'accord converge, le désaccord était du bruit et la redondance le corrige. S'il reste plat, l'item est réellement ambigu, et la bonne réponse est d'enregistrer la distribution plutôt que de forcer une étiquette unique.
La formation change l'accord plus que le type d'annotateur
Bayerl and Paul (2011) ont réalisé une méta-analyse de 96 études d'annotation portant sur la désambiguïsation du sens des mots, la transcription prosodique et la transcription phonétique, couvrant 346 indices d'accord. Sept facteurs expliquaient la variation de l'accord, et deux d'entre eux concernent la formation, à savoir si les annotateurs ont été formés et à quel point la formation était intensive. Les autres sont le domaine d'annotation, le nombre de catégories du schéma, le nombre d'annotateurs, la finalité de l'annotation et la méthode de calcul du pourcentage d'accord.
Ce résultat recadre la décision entre experts et foule. Un annotateur de la foule formé, travaillant à partir d'un schéma testé comportant peu de catégories, obtiendra souvent un meilleur accord qu'un spécialiste non formé travaillant à partir d'un schéma vague. Rédiger des consignes d'annotation et choisir un schéma d'annotation font plus pour l'accord que le canal de recrutement.
Là où l'annotation par la foule échoue
Trois conditions font de la foule le mauvais choix. Le jugement exige un savoir certifié, comme dans le codage clinique ou juridique, où une étiquette fausse n'est pas seulement bruitée. Les données ne peuvent pas quitter votre infrastructure, ce qui écarte une place de marché publique quelle que soit la qualité. L'ensemble d'étiquettes est assez vaste ou assez hiérarchique pour que le coût de formation par annotateur dépasse l'économie, ce qui est courant au-delà de quelques dizaines de catégories.
Quand la première condition est remplie mais que le volume est élevé, un dispositif mixte l'emporte généralement sur les deux extrêmes. Des experts annotent un sous-ensemble, ce sous-ensemble devient l'étalon-or, et les annotateurs de la foule sont filtrés dessus avant d'accéder à la vraie tâche. Étalons-or et contrôles d'attention couvre la mécanique du filtrage.
Pour aller plus loin
- Combien d'annotateurs faut-il ? détaille la redondance et la puissance statistique.
- Agréger les étiquettes de la foule traite de la combinaison des jugements une fois recueillis.
- Crowdsourcing avec Prolific et MTurk traite du recrutement et de la rémunération.
- L'accord inter-annotateurs expliqué traite des coefficients.
Références
Snow, R., O'Connor, B., Jurafsky, D., and Ng, A. Y. (2008). Cheap and Fast – But is it Good? Evaluating Non-Expert Annotations for Natural Language Tasks. Proceedings of EMNLP 2008, 254-263. https://aclanthology.org/D08-1027/
Callison-Burch, C. (2009). Fast, Cheap, and Creative: Evaluating Translation Quality Using Amazon's Mechanical Turk. Proceedings of EMNLP 2009, 286-295. https://aclanthology.org/D09-1030/
Dawid, A. P., and Skene, A. M. (1979). Maximum Likelihood Estimation of Observer Error-Rates Using the EM Algorithm. Journal of the Royal Statistical Society. Series C (Applied Statistics), 28(1), 20-28. https://doi.org/10.2307/2346806
Hovy, D., Berg-Kirkpatrick, T., Vaswani, A., and Hovy, E. (2013). Learning Whom to Trust with MACE. Proceedings of NAACL-HLT 2013, 1120-1130. https://aclanthology.org/N13-1132/
Plank, B., Hovy, D., and Søgaard, A. (2014). Linguistically debatable or just plain wrong? Proceedings of ACL 2014 (Volume 2: Short Papers), 507-511. https://doi.org/10.3115/v1/P14-2083
Pavlick, E., and Kwiatkowski, T. (2019). Inherent Disagreements in Human Textual Inferences. Transactions of the Association for Computational Linguistics, 7, 677-694. https://aclanthology.org/Q19-1043/
Bayerl, P. S., and Paul, K. I. (2011). What Determines Inter-Coder Agreement in Manual Annotations? A Meta-Analytic Investigation. Computational Linguistics, 37(4), 699-725. https://doi.org/10.1162/COLI_a_00074
Alfter, D., Lindström Tiedemann, T., and Volodina, E. (2022). Crowdsourcing Relative Rankings of Multi-Word Expressions: Experts versus Non-Experts. Northern European Journal of Language Technology, 7(1). https://doi.org/10.3384/nejlt.2000-1533.2021.3128
Plank, B. (2022). The "Problem" of Human Label Variation: On Ground Truth in Data, Modeling and Evaluation. Proceedings of EMNLP 2022, 10671-10682. https://doi.org/10.18653/v1/2022.emnlp-main.731