Truth Serum
Bewertung nach dem Prinzip der überraschend beliebten Antwort für die Annotation. Eine einzige zusätzliche Mikrofrage pro Label reicht, damit Potato bei schwierigen Elementen besser abschneidet als die Mehrheitsentscheidung, und das ganz ohne Gold-Labels.
Neu in v2.7.0
Die Mehrheitsentscheidung versagt genau dort, wo Annotation schwierig ist: wenn eine selbstsichere Menge falschliegt und eine informierte Minderheit recht hat. Truth Serum stellt nach jedem Label eine Mikrofrage.
Du hast Sarcastic gewählt. Welcher Prozentsatz der anderen Annotatoren wird dasselbe Label wählen wie du?

Ein Schieberegler, ein Klick. Diese Vorhersagen speisen das Prinzip der überraschend beliebten Antwort (Prelec 2004; Prelec, Seung & McCoy 2017, Nature): Das Label, dessen tatsächliche Beliebtheit seine vorhergesagte Beliebtheit am stärksten übertrifft, ist die beste verfügbare Schätzung der Wahrheit, und für die Berechnung braucht es keine Gold-Labels.
Dahinter steht der Gedanke, dass Menschen mit einer richtigen Minderheitsmeinung meist wissen, dass sie in der Minderheit sind, sodass ihre Antwort am Ende beliebter ausfällt, als irgendwer vorhergesagt hat.
Soweit wir wissen, ist Potato das erste Annotationswerkzeug mit Peer-Prediction-Bewertung.
Was man bekommt
- Element-Urteile, die bei schwierigen Elementen die Mehrheitsentscheidung schlagen. Die Dashboard-Liste „Wo die Menge wahrscheinlich falschliegt" führt jede Instanz auf, deren überraschend beliebtes Label vom Mehrheitslabel abweicht. Diese zuerst durchsehen oder in die Adjudikation geben.
- Kalibrierungswerte je Annotator. Wie weit die vorhergesagte Zustimmung eines Annotators von der Zustimmung abweicht, die er tatsächlich von den anderen bekommen hat. Selbstüberschätzung und schlechte Kalibrierung zeigen sich ohne eine einzige Goldfrage.
- SP-Übereinstimmung. Wie oft das Label eines Annotators mit dem überraschend beliebten Urteil zusammenfällt, was ein Indiz dafür ist, informiert zu sein statt bloß gefällig.
Konfiguration
truth_serum:
enabled: true
schema: sarcasm # scheme to collect predictions for (default: first radio)
min_annotators: 3 # predictions per item before a verdict is computed
# question: "What percentage of other annotators will choose the same label as you?"| Option | Standard | Beschreibung |
|---|---|---|
enabled | false | Hauptschalter. |
schema | erstes radio-Schema | Für welches Schema Beliebtheitsvorhersagen erhoben werden. |
question | siehe oben | Der Text über dem Schieberegler. |
min_annotators | 3 | Mindestzahl an Vorhersagen pro Element, bevor ein Urteil berechnet wird (Untergrenze: 2). |
Methodische Hinweise
Diese Hinweise gehören gelesen, bevor Truth Serum in einem Paper zitiert wird.
- Dies ist die vereinfachte Variante mit Vorhersage zur eigenen Antwort. Jeder Annotator sagt die Beliebtheit des von ihm gewählten Labels vorher und nicht eine vollständige Verteilung über alle Labels. Die vorhergesagte Beliebtheit eines Labels ist der Mittelwert der Vorhersagen seiner Unterstützer, seine Überraschung ist
actual % − predicted %, und das SP-Urteil ist das gewählte Label mit der größten Überraschung. - Urteile werden erst ab
min_annotatorsVorhersagen berechnet. Urteile aus kleinen Stichproben rauschen; 3 ist eine Untergrenze und keine Empfehlung, 5 oder mehr sind besser. - Der Kalibrierungsfehler vergleicht jede Vorhersage mit der Übereinstimmung unter den übrigen Annotatoren dieses Elements, ohne den Annotator selbst.
- Annotatoren dürfen korrigieren. Es gilt das jeweils letzte Paar aus (Label, Vorhersage) pro Instanz.
Daten und API
Vorhersagen werden nach {output_annotation_dir}/truth_serum/predictions.jsonl geschrieben (nur anhängend; es gilt der jeweils letzte Datensatz pro Annotator und Instanz).
| Endpunkt | Methode | Auth | Zweck |
|---|---|---|---|
/truth_serum/api/predict | POST | Sitzung | Label + vorhergesagten Prozentsatz erfassen |
/truth_serum/api/mine | GET | Sitzung | Vorhersage dieses Annotators (Wiederherstellung des Widgets) |
/truth_serum/dashboard | GET | Admin | Dashboard mit Urteilen und Kalibrierung |
/truth_serum/api/stats | GET | Admin | Dashboard-Aggregate |
/truth_serum/api/export | GET | Admin | Vollständiger JSON-Export (Urteile + Rohvorhersagen) |
Weiterführende Informationen
- Psychometrie — Labels mit Posterior-Wahrscheinlichkeiten und Konfidenzintervallen
- Boundary Lab — Qualitätskontrolle aus kontrafaktischen Sonden
- MACE — Kompetenzschätzung, die sich mit der Kalibrierungssicht von Truth Serum ergänzt
- Crowd-Labels aggregieren
- Quelldokumentation