Skip to content

Goldstandards und Aufmerksamkeitstests

Wie du mit Goldstandard-Elementen und Aufmerksamkeitstests schwache Annotierende erkennst und ein Projekt kalibriert hältst, samt Konfiguration in Potato.

Goldstandards und Aufmerksamkeitstests sind Elemente, deren richtige Antwort du bereits kennst. Mischst du sie unter die übrigen Daten, kannst du die Genauigkeit jeder annotierenden Person messen und diejenigen erkennen, die hetzen, etwas missverstanden haben oder die Aufgabe austricksen wollen. Sie sind die erste Verteidigungslinie der Qualitätskontrolle, besonders beim Crowdsourcing.

Goldstandards

Ein Goldstandard-Element hat eine von Fachleuten geprüfte Antwort. Streue solche Elemente ein und vergleiche die Antworten damit, dann bekommst du pro Person einen Genauigkeitswert. Goldelemente können still laufen (nur zur Bewertung) oder sofort Rückmeldung geben (zum Training).

yaml
gold_standards:
  enabled: true
  items_file: "gold_standards.json"
  mode: mixed       # silent scoring + occasional feedback
  frequency: 20     # roughly one gold item per 20

Bau dein Goldset aus den eindeutigen Fällen, die deine Richtlinien geklärt haben. Nimm keine wirklich mehrdeutigen Elemente als Gold, sonst bestrafst du gute Annotierende für vertretbare Entscheidungen.

Aufmerksamkeitstests

Ein Aufmerksamkeitstest ist ein Element, dessen Antwort offensichtlich in der Anweisung steht (etwa: Wähle bei diesem Element die Option Stimme nicht zu). Er erwischt Annotierende, die nicht lesen. Potato kann außerdem auffällige Bearbeitungszeiten melden, also Antworten, die schneller kommen, als ein Mensch den Text lesen könnte.

yaml
attention_checks:
  enabled: true
  items_file: "attention_checks.json"
  frequency: 10

Was du aus dem Signal machst

  • Leg eine Mindestgenauigkeit fest. Wer darunter bleibt, wird nachgeschult oder ausgeschlossen.
  • Kombiniere das mit einer Trainingsphase. Verlange ein Bestehen auf den Goldelementen, bevor die echte Arbeit beginnt.
  • Prüfe nicht zu viel. Zu viele Kontrollen nerven gute Annotierende und treiben die Kosten. Eine kleine, gleichmäßige Rate reicht.

Wie sich die Kompetenz einzelner Annotierender schätzen und Labels statistisch aus Uneinigkeit ableiten lassen, steht unter Adjudikation und Uneinigkeit und bei Potatos MACE-Unterstützung.

Weiterführende Lektüre