Skip to content

Truth Serum

Bewertung nach dem Prinzip der überraschend beliebten Antwort für die Annotation. Eine einzige zusätzliche Mikrofrage pro Label reicht, damit Potato bei schwierigen Elementen besser abschneidet als die Mehrheitsentscheidung, und das ganz ohne Gold-Labels.

Neu in v2.7.0

Die Mehrheitsentscheidung versagt genau dort, wo Annotation schwierig ist: wenn eine selbstsichere Menge falschliegt und eine informierte Minderheit recht hat. Truth Serum stellt nach jedem Label eine Mikrofrage.

Du hast Sarcastic gewählt. Welcher Prozentsatz der anderen Annotatoren wird dasselbe Label wählen wie du?

Peer-Prediction-Bewertung: „Welcher Prozentsatz der anderen Annotatoren wird dasselbe Label wählen?"

Ein Schieberegler, ein Klick. Diese Vorhersagen speisen das Prinzip der überraschend beliebten Antwort (Prelec 2004; Prelec, Seung & McCoy 2017, Nature): Das Label, dessen tatsächliche Beliebtheit seine vorhergesagte Beliebtheit am stärksten übertrifft, ist die beste verfügbare Schätzung der Wahrheit, und für die Berechnung braucht es keine Gold-Labels.

Dahinter steht der Gedanke, dass Menschen mit einer richtigen Minderheitsmeinung meist wissen, dass sie in der Minderheit sind, sodass ihre Antwort am Ende beliebter ausfällt, als irgendwer vorhergesagt hat.

Soweit wir wissen, ist Potato das erste Annotationswerkzeug mit Peer-Prediction-Bewertung.

Was man bekommt

  1. Element-Urteile, die bei schwierigen Elementen die Mehrheitsentscheidung schlagen. Die Dashboard-Liste „Wo die Menge wahrscheinlich falschliegt" führt jede Instanz auf, deren überraschend beliebtes Label vom Mehrheitslabel abweicht. Diese zuerst durchsehen oder in die Adjudikation geben.
  2. Kalibrierungswerte je Annotator. Wie weit die vorhergesagte Zustimmung eines Annotators von der Zustimmung abweicht, die er tatsächlich von den anderen bekommen hat. Selbstüberschätzung und schlechte Kalibrierung zeigen sich ohne eine einzige Goldfrage.
  3. SP-Übereinstimmung. Wie oft das Label eines Annotators mit dem überraschend beliebten Urteil zusammenfällt, was ein Indiz dafür ist, informiert zu sein statt bloß gefällig.

Konfiguration

yaml
truth_serum:
  enabled: true
  schema: sarcasm            # scheme to collect predictions for (default: first radio)
  min_annotators: 3          # predictions per item before a verdict is computed
  # question: "What percentage of other annotators will choose the same label as you?"
OptionStandardBeschreibung
enabledfalseHauptschalter.
schemaerstes radio-SchemaFür welches Schema Beliebtheitsvorhersagen erhoben werden.
questionsiehe obenDer Text über dem Schieberegler.
min_annotators3Mindestzahl an Vorhersagen pro Element, bevor ein Urteil berechnet wird (Untergrenze: 2).

Methodische Hinweise

Diese Hinweise gehören gelesen, bevor Truth Serum in einem Paper zitiert wird.

  • Dies ist die vereinfachte Variante mit Vorhersage zur eigenen Antwort. Jeder Annotator sagt die Beliebtheit des von ihm gewählten Labels vorher und nicht eine vollständige Verteilung über alle Labels. Die vorhergesagte Beliebtheit eines Labels ist der Mittelwert der Vorhersagen seiner Unterstützer, seine Überraschung ist actual % − predicted %, und das SP-Urteil ist das gewählte Label mit der größten Überraschung.
  • Urteile werden erst ab min_annotators Vorhersagen berechnet. Urteile aus kleinen Stichproben rauschen; 3 ist eine Untergrenze und keine Empfehlung, 5 oder mehr sind besser.
  • Der Kalibrierungsfehler vergleicht jede Vorhersage mit der Übereinstimmung unter den übrigen Annotatoren dieses Elements, ohne den Annotator selbst.
  • Annotatoren dürfen korrigieren. Es gilt das jeweils letzte Paar aus (Label, Vorhersage) pro Instanz.

Daten und API

Vorhersagen werden nach {output_annotation_dir}/truth_serum/predictions.jsonl geschrieben (nur anhängend; es gilt der jeweils letzte Datensatz pro Annotator und Instanz).

EndpunktMethodeAuthZweck
/truth_serum/api/predictPOSTSitzungLabel + vorhergesagten Prozentsatz erfassen
/truth_serum/api/mineGETSitzungVorhersage dieses Annotators (Wiederherstellung des Widgets)
/truth_serum/dashboardGETAdminDashboard mit Urteilen und Kalibrierung
/truth_serum/api/statsGETAdminDashboard-Aggregate
/truth_serum/api/exportGETAdminVollständiger JSON-Export (Urteile + Rohvorhersagen)

Weiterführende Informationen