Le désaccord est un signal, pas du bruit : quand conserver le désaccord entre annotateurs au lieu de le résoudre
Les chaînes d'annotation sont bâties pour effacer le désaccord, mais sur les tâches subjectives le désaccord est la donnée. Guide pour distinguer la vraie variation d'étiquetage de l'erreur, et la conserver dans Potato.
La chaîne d'annotation classique est une machine à produire de l'accord. Vous rédigez des consignes, formez des annotateurs, mesurez l'accord inter-annotateurs, arbitrez les cas où les gens divergent, et livrez une seule étiquette de référence par élément. Chaque étape est conçue pour évacuer le désaccord, en supposant que le désaccord est une erreur et qu'il faut la minimiser. Pour beaucoup de tâches, cette hypothèse tient. Pour beaucoup d'autres, elle jette une variation bien réelle dans la façon dont les gens lisent l'élément.
Quand des annotateurs divergent, le désaccord est tantôt une erreur à résoudre, tantôt une variation authentique à conserver. Sur les tâches objectives qui ont une vraie bonne réponse, réduisez à une étiquette de référence. Sur les tâches subjectives ou perspectivistes, une étiquette de référence unique efface une distribution réelle du jugement humain ; mieux vaut garder l'étiquette de chaque annotateur, stocker une distribution plutôt qu'un vainqueur, et mesurer l'accord sans supposer qu'en dessous de la perfection quelque chose est cassé.
L'hypothèse de l'étiquette de référence unique
L'apprentissage automatique suppose encore le plus souvent qu'il existe une interprétation correcte par élément, d'où le réflexe d'agrégation en annotation : prendre trois étiquettes, prendre la majorité, appeler cela la vérité. Plank (2022) a nommé cela le « problème » de la variation humaine d'étiquetage, guillemets compris, parce que c'est le cadrage qui pose problème. La variation authentique dans la façon d'étiqueter n'est pas toujours du bruit autour d'une vraie valeur cachée. Parfois il n'y a pas de valeur vraie unique, et l'étalement des réponses est la description honnête de l'élément.
La littérature de synthèse le confirme sur un large éventail de tâches. Uma et ses collègues (2021) ont passé en revue l'apprentissage à partir du désaccord en TAL et en vision par ordinateur et ont trouvé du désaccord humain partout, de l'étiquetage morphosyntaxique à l'inférence en langue naturelle, ainsi qu'un ensemble croissant de méthodes qui apprennent du désaccord au lieu de le moyenner. Le tournant perspectiviste (Cabitza, Campagner et Basile, 2021) va plus loin : agréger par vote majoritaire peut activement induire en erreur, et une meilleure pratique conserve les perspectives des personnes qui ont étiqueté.
D'où vient le désaccord
Tous les désaccords ne signifient pas la même chose ; il est donc utile de se demander d'où vient un désaccord donné. Trois sources en couvrent l'essentiel.
- Les consignes. Deux annotateurs lisent la même règle différemment, ou la règle ne couvre pas le cas qu'ils ont devant eux. Ce désaccord est un défaut, et le correctif consiste à clarifier la consigne, pas à conserver l'écart. Une phase pilote existe précisément pour attraper cela.
- L'annotateur. Quelqu'un s'est précipité, a mal lu, ou c'est un travailleur peu soigneux qui clique à la chaîne. C'est une erreur, à détecter et à retirer. Ce n'est pas la même chose qu'une variation authentique, et confondre les deux, c'est ainsi que « conserver le désaccord » devient « conserver le bruit ».
- L'élément. Le texte est réellement ambigu, ou le jugement dépend réellement de qui lit. Cette blague est-elle offensante ? Cet avis est-il positif ou mitigé ? Ici, des réponses différentes ne sont pas des erreurs. C'est le désaccord qui mérite d'être conservé.
Séparer la troisième source des deux premières constitue l'essentiel du travail. Les problèmes de consignes se corrigent et les erreurs d'annotateurs se filtrent. Ce qui reste est la variation authentique au niveau de l'élément, et c'est cela qu'il faut garder.
Remontez chaque désaccord à sa source : corrigez la consigne, filtrez l'erreur, gardez la variation authentique
Tâche objective ou tâche subjective
La règle empirique la plus nette : une personne compétente et attentive pourrait-elle être certaine de la réponse ? Si oui, la tâche est objective, une étiquette de référence a du sens, et le désaccord est à résoudre. Savoir si une date est le 3 avril ou le 4 mars a une réponse. Savoir si une phrase contient une entité nommée a une réponse, la plupart du temps.
Si une personne compétente et attentive peut malgré tout aboutir ailleurs pour des raisons légitimes, la tâche est subjective, et imposer une étiquette de référence invente une certitude que les données n'ont pas. Offense, toxicité, humour, politesse, prise de position, esthétique d'une image : tout cela dépend de qui juge, et la variation entre juges est souvent la propriété qui vous intéresse vraiment. C'est aussi là que les caractéristiques démographiques des annotateurs apparaissent dans les étiquettes, ce qui est toute la raison de les recueillir et de les rapporter.
La plupart des projets réels ne sont pas purement l'un ou l'autre. Mesurez d'abord l'accord, puis lisez-le. Un accord élevé signifie que la tâche se comporte de façon objective et que vous pouvez agréger. Un accord qui reste moyen sur une tâche subjective décrit une distribution réelle, et préserver cette distribution vaut mieux que tenter de faire monter le chiffre de force.
Stocker des étiquettes désagrégées
Préserver le désaccord est surtout une décision sur ce que vous stockez. Au lieu d'une étiquette par élément, vous gardez les étiquettes désagrégées : le jugement de chaque annotateur, rattaché à cet annotateur. De là, vous pouvez construire une étiquette souple, une distribution sur les catégories plutôt qu'un vainqueur unique, et entraîner ou évaluer contre cette distribution.
Agréger vers une étiquette de référence et perdre l'écart, ou conserver la distribution désagrégée
Cela change aussi l'évaluation. Un modèle qui prédit une distribution peut être noté contre la distribution humaine plutôt que contre une étiquette unique, et se trouve donc récompensé d'être incertain là où les gens le sont. Sur les tâches subjectives, c'est une cible plus honnête que l'exactitude face à un vote majoritaire que la moitié des annotateurs contestaient.
Rien de tout cela ne revient à abandonner l'accord inter-annotateurs. Vous mesurez toujours l'accord ; vous cessez simplement de traiter tout chiffre inférieur à 1,0 comme un défaut à éliminer. L'accord vous dit à quel point la tâche se comporte de façon objective. Agréger ou non est une décision distincte, que vous prenez ce chiffre en main.
Le faire dans Potato
Potato n'impose pas le consensus. Quand plusieurs annotateurs étiquettent le même élément, leurs étiquettes sont stockées par annotateur : les données désagrégées, matière première de toute approche fondée sur les distributions, sont donc ce que vous obtenez par défaut. Vous choisissez d'agréger plus tard, au lieu de perdre l'écart au moment de la collecte.
Pour les tâches où le désaccord porte vraiment sur un degré, le type soft_label permet à un annotateur unique d'exprimer directement une distribution, en répartissant des points entre les catégories au lieu d'en choisir une :
annotation_schemes:
- annotation_type: soft_label
name: emotion_mix
description: Distribute 100 points to reflect how much each emotion applies.
labels: ["Joy", "Sadness", "Anger", "Fear", "Surprise"]
total: 100
show_distribution_chart: truePour séparer l'ambiguïté authentique de l'erreur d'annotateur, MACE aide. Il estime conjointement un score de compétence par annotateur et une entropie par élément : un annotateur peu compétent (la source d'erreur) et un élément à forte entropie (la source de variation authentique) apparaissent donc comme deux choses distinctes plutôt que comme un même tas indifférencié de désaccord :
mace:
enabled: true
min_annotations_per_item: 3Un annotateur autour de 0,4 de compétence clique probablement à la chaîne et peut être filtré. Un élément à forte entropie parmi des annotateurs par ailleurs fiables est réellement contesté, et c'est ce désaccord-là que vous gardez. Quand une tâche exige vraiment une réponse unique, l'arbitrage est là pour les cas objectifs, avec l'étiquette prédite par MACE comme signal supplémentaire pour l'arbitre. Résoudre le désaccord devient une décision propre à chaque tâche plutôt qu'un automatisme de la chaîne.
Où aller ensuite
- Recueillir les données démographiques des annotateurs de façon responsable, pour comprendre pourquoi la variation entre juges est souvent le signal.
- Documenter votre jeu de données d'annotation, pour rapporter ensemble étiquettes désagrégées et accord.
- L'accord inter-annotateurs expliqué, pour mesurer l'accord sans supposer que le désaccord est un échec.
- Arbitrage et résolution des désaccords, pour les cas objectifs où une étiquette unique est le bon choix.
Deux jeux de données subjectifs à regarder : GoEmotions, pour des étiquettes d'émotion fines et souvent contestées, et Social Chemistry, pour des jugements de normes sociales sur lesquels des gens raisonnables divergent.