Skip to content

Experten- gegenüber Crowd-Annotation

Wann Crowd-Annotatoren an Experten heranreichen, wie viele pro Item nötig sind, was die beiden Wege kosten und wie man die Kompetenz der Annotatoren modelliert, statt der Mehrheitsentscheidung zu trauen.

Setzen Sie Crowd-Annotatoren ein, wenn eine sorgfältige Person ohne Fachausbildung, die Ihren Richtlinien folgt, zum selben Urteil käme wie eine Fachperson, und erheben Sie mehrere Urteile pro Item statt eines einzigen. Snow et al. (2008) fanden, dass im Durchschnitt vier Nicht-Experten-Annotationen die Übereinstimmung eines einzelnen Experten-Annotators erreichten, über fünf Aufgaben zur natürlichen Sprache hinweg.

Die Wahl zwischen Experten und Crowd wird meist als Abwägung zwischen Qualität und Kosten dargestellt, und das ist für die meisten Aufgaben der falsche Rahmen. Die Frage ist, ob das Urteil von einer Ausbildung abhängt, die die Crowd nicht hat. Sentiment, Textual Entailment und Wortähnlichkeit tun das meist nicht. Klinische Kodierung, juristische Klassifikation und phonetische Transkription tun es meist doch.

Was die Befunde stützen

Das grundlegende Ergebnis stammt von Snow et al. (2008), die Nicht-Experten-Annotationen von Amazon Mechanical Turk gegen Experten-Goldstandards verglichen, bei Affekterkennung, Wortähnlichkeit, Recognizing Textual Entailment, zeitlicher Ereignisordnung und Wortsinn-Disambiguierung. Über die Aufgaben hinweg zusammengefasst berichten sie, dass "nur 4 Nicht-Experten-Annotationen pro Beispiel nötig sind, um die gleiche ITA zu erreichen wie ein einzelner Experten-Annotator" ("it requires only 4 non-expert annotations per example to achieve the equivalent ITA as a single expert annotator"). Für die Kosten nennen sie eine Rate statt eines Verhältnisses: Sie erhoben 7000 Affekt-Annotationen für zwei Dollar und beschreiben das als "mindestens 875 expertenäquivalente Labels pro USD" ("at least 875 expert-equivalent labels per USD").

Die Streuung zwischen den Aufgaben innerhalb dieses Durchschnitts wiegt schwerer als der Durchschnitt. In ihrer Affekt-Aufgabe erreichten Wut, Ekel und Traurigkeit das Expertenniveau mit zwei Nicht-Experten, Überraschung brauchte neun, und Furcht erreichte es innerhalb der zehn erhobenen Annotatoren nie. Ein Durchschnitt auf Aufgabenebene verdeckt die Labels, bei denen die Crowd Ausbildung nicht ersetzen kann.

Callison-Burch (2009) fand dasselbe Muster bei der Bewertung maschineller Übersetzung: Er stellte die WMT08-Urteile für zehn Dollar nach und berichtete, dass kombinierte Nicht-Experten-Urteile "stärker mit Expertenurteilen korrelieren als Bleu" ("correlate more strongly with expert judgments than Bleu does").

Das Gegengewicht ist, dass Experten manchmal schneller sind. Alfter et al. (2022) führten eine Best-Worst-Scaling-Aufgabe zu Mehrwortausdrücken mit Zweitsprachensprechenden, Sprachprofis und GER-Experten durch. Die Rangfolgen der drei Gruppen korrelierten hoch, die Qualität war also vergleichbar, doch die direkte Expertenannotation dauerte 15 bis 90 Minuten pro Projekt gegenüber rund acht bis neun Stunden für die Crowd-Variante, was sie als "mindestens fünfmal so schnell" ("at least five times as fast") beschreiben. Wo ohnehin eine kleine Zahl von Fachleuten verfügbar ist, kann die Auslagerung an eine Crowd mehr Zeit kosten, als sie spart.

Der Mechanismus ist die Redundanz, nicht die Crowd

Ein einzelnes Crowd-Urteil ist in jeder der obigen Studien schlechter als ein einzelnes Expertenurteil. Was die Lücke schließt, ist das Erheben mehrerer Urteile pro Item und deren Kombination, also lautet die Entwurfsfrage, wie man sie kombiniert.

Die Mehrheitsentscheidung behandelt alle Annotatoren als gleich zuverlässig, was sie nicht sind. Zwei Modelle schätzen die Zuverlässigkeit stattdessen aus den Daten. Dawid and Skene (1979) führten ein Expectation-Maximization-Verfahren ein, das je Beobachter eine Konfusionsmatrix zusammen mit den latenten wahren Labels schätzt, ursprünglich für Beobachtungsfehler in der Klinik. MACE, kurz für Multi-Annotator Competence Estimation, ist ein Item-Response-Modell für den Crowdsourcing-Fall, das ohne Supervision lernt, welche Annotatoren vertrauenswürdig sind, und die zugrunde liegenden Labels vorhersagt. Die Autoren bauten es, weil "manche Annotatoren schlechte Labels wählen, um ihre Bezahlung zu maximieren" ("some annotators choose bad labels in order to maximize their pay"), ein Fehlermodus, den die Mehrheitsentscheidung stillschweigend aufnimmt, wenn ihn genügend Annotatoren teilen.

Potato bringt beides mit. Ein mace-Block führt die Kompetenzschätzung über den erhobenen Annotationen aus, und der Dawid-Skene-Rechner wendet den Schätzer auf eingefügte Labels an.

yaml
mace:
  enabled: true
 
num_annotators_per_item: 4
 
gold_standards:
  enabled: true
 
attention_checks:
  enabled: true

num_annotators_per_item: 4 folgt dem Befund von Snow et al. und keinem Hausstandard, und es ist der Wert, den man je Aufgabe neu prüfen und nicht von Projekt zu Projekt mitschleppen sollte. Goldstandards und Aufmerksamkeitsprüfungen fangen den Annotator ab, der nicht liest, womit Kompetenzmodelle besser umgehen, wenn sie ein paar verankerte Items zum Kalibrieren haben.

Uneinigkeit ist nicht automatisch Fehler

Jede Uneinigkeit als Qualitätsproblem zu behandeln führt zur falschen Maßnahme. Plank et al. (2014) analysierten Uneinigkeiten zwischen Annotatoren in der Wortarten-Annotation und fanden, dass "nur 2% der Annotatorentscheidungen linguistisch unmotiviert sind" ("only 2% of annotator choices are linguistically unmotivated"), und schlossen daraus, dass die meisten Uneinigkeiten aus linguistisch strittigen Fällen stammen und nicht aus Fehlern.

Pavlick and Kwiatkowski (2019) prüften, ob Uneinigkeit bei natürlichsprachlicher Inferenz mit mehr Daten verschwindet, und das tut sie nicht. Sie berichten, dass Uneinigkeiten "nicht als Annotations-'Rauschen' abzutun sind, sondern fortbestehen, während wir mehr Bewertungen erheben und während wir die Menge des den Bewertenden gegebenen Kontexts variieren" ("are not dismissible as annotation 'noise', but rather persist as we collect more ratings and as we vary the amount of context provided to raters"). Plank (2022) verallgemeinert den Punkt als menschliche Labelvariation.

Der praktische Test ist billig. Erheben Sie mehr Urteile zu den Items, bei denen die Annotatoren uneins sind. Konvergiert die Übereinstimmung, war die Uneinigkeit Rauschen, und Redundanz behebt sie. Bleibt sie flach, ist das Item wirklich mehrdeutig, und die richtige Reaktion ist, die Verteilung festzuhalten, statt ein einziges Label zu erzwingen.

Schulung verändert die Übereinstimmung stärker als der Annotatorentyp

Bayerl and Paul (2011) führten eine Metaanalyse über 96 Annotationsstudien zu Wortsinn-Disambiguierung, prosodischer Transkription und phonetischer Transkription durch, die 346 Übereinstimmungsindizes umfasste. Sieben Faktoren erklärten die Variation der Übereinstimmung, und zwei davon betreffen Schulung, nämlich ob die Annotatoren überhaupt geschult wurden und wie intensiv. Die übrigen sind die Annotationsdomäne, die Zahl der Kategorien im Schema, die Zahl der Annotatoren, der Zweck der Annotation und die Methode zur Berechnung der prozentualen Übereinstimmung.

Dieses Ergebnis verschiebt die Entscheidung zwischen Experten und Crowd. Ein geschulter Crowd-Annotator, der mit einem erprobten Schema mit wenigen Kategorien arbeitet, erreicht oft mehr Übereinstimmung als eine ungeschulte Fachperson mit einem vagen Schema. Annotationsrichtlinien schreiben und ein Annotationsschema wählen bringen für die Übereinstimmung mehr als der Rekrutierungskanal.

Wo Crowd-Annotation scheitert

Drei Bedingungen machen die Crowd zur falschen Wahl. Das Urteil verlangt zertifiziertes Wissen, wie bei klinischer oder juristischer Kodierung, wo ein falsches Label nicht bloß verrauscht ist. Die Daten dürfen Ihre Infrastruktur nicht verlassen, was einen öffentlichen Marktplatz unabhängig von der Qualität ausschließt. Die Labelmenge ist so groß oder hierarchisch, dass die Schulungskosten pro Annotator die Ersparnis übersteigen, was oberhalb von grob einigen Dutzend Kategorien häufig vorkommt.

Wenn die erste Bedingung gilt, das Volumen aber hoch ist, schlägt ein gemischtes Design meist beide Extreme. Experten labeln eine Teilmenge, diese Teilmenge wird zum Goldstandard, und Crowd-Annotatoren werden daran geprüft, bevor sie an die eigentliche Aufgabe kommen. Goldstandards und Aufmerksamkeitsprüfungen behandelt die Mechanik dieser Prüfung.

Weiterführendes

Literatur

Snow, R., O'Connor, B., Jurafsky, D., and Ng, A. Y. (2008). Cheap and Fast – But is it Good? Evaluating Non-Expert Annotations for Natural Language Tasks. Proceedings of EMNLP 2008, 254-263. https://aclanthology.org/D08-1027/

Callison-Burch, C. (2009). Fast, Cheap, and Creative: Evaluating Translation Quality Using Amazon's Mechanical Turk. Proceedings of EMNLP 2009, 286-295. https://aclanthology.org/D09-1030/

Dawid, A. P., and Skene, A. M. (1979). Maximum Likelihood Estimation of Observer Error-Rates Using the EM Algorithm. Journal of the Royal Statistical Society. Series C (Applied Statistics), 28(1), 20-28. https://doi.org/10.2307/2346806

Hovy, D., Berg-Kirkpatrick, T., Vaswani, A., and Hovy, E. (2013). Learning Whom to Trust with MACE. Proceedings of NAACL-HLT 2013, 1120-1130. https://aclanthology.org/N13-1132/

Plank, B., Hovy, D., and Søgaard, A. (2014). Linguistically debatable or just plain wrong? Proceedings of ACL 2014 (Volume 2: Short Papers), 507-511. https://doi.org/10.3115/v1/P14-2083

Pavlick, E., and Kwiatkowski, T. (2019). Inherent Disagreements in Human Textual Inferences. Transactions of the Association for Computational Linguistics, 7, 677-694. https://aclanthology.org/Q19-1043/

Bayerl, P. S., and Paul, K. I. (2011). What Determines Inter-Coder Agreement in Manual Annotations? A Meta-Analytic Investigation. Computational Linguistics, 37(4), 699-725. https://doi.org/10.1162/COLI_a_00074

Alfter, D., Lindström Tiedemann, T., and Volodina, E. (2022). Crowdsourcing Relative Rankings of Multi-Word Expressions: Experts versus Non-Experts. Northern European Journal of Language Technology, 7(1). https://doi.org/10.3384/nejlt.2000-1533.2021.3128

Plank, B. (2022). The "Problem" of Human Label Variation: On Ground Truth in Data, Modeling and Evaluation. Proceedings of EMNLP 2022, 10671-10682. https://doi.org/10.18653/v1/2022.emnlp-main.731