Truth Serum
La notation par réponse étonnamment populaire, appliquée à l'annotation. Une micro-question de plus après chaque étiquette permet à Potato de battre le vote majoritaire sur les éléments difficiles, sans la moindre étiquette étalon.
Nouveau dans la v2.7.0
Le vote majoritaire échoue exactement là où l'annotation est difficile : quand une foule sûre d'elle se trompe et qu'une minorité informée a raison. Truth Serum ajoute une micro-question après chaque étiquette.
Vous avez choisi Sarcastic. Quel pourcentage des autres annotateurs choisira la même étiquette que vous ?

Un curseur, un clic. Ces prédictions alimentent le principe de la réponse étonnamment populaire (Prelec 2004 ; Prelec, Seung & McCoy 2017, Nature) : l'étiquette dont la popularité réelle dépasse le plus sa popularité prédite est la meilleure estimation disponible de la vérité, et la calculer ne demande aucune étiquette étalon.
L'intuition est que les personnes qui tiennent une position minoritaire correcte savent en général qu'elles sont minoritaires, si bien que leur réponse finit plus populaire que personne ne l'avait prédit.
À notre connaissance, Potato est le premier outil d'annotation à proposer la notation par prédiction des pairs.
Ce que vous obtenez
- Des verdicts d'élément qui battent le vote majoritaire sur les cas difficiles. La file « Là où la foule se trompe probablement » du tableau de bord liste chaque instance dont l'étiquette étonnamment populaire diffère de l'étiquette majoritaire. Passez-les en revue en priorité, ou envoyez-les en arbitrage.
- Des scores de calibrage par annotateur. L'écart entre l'accord que chaque annotateur avait prédit et celui qu'il a réellement obtenu de ses pairs. Les annotateurs trop sûrs d'eux et mal calibrés ressortent sans aucune question étalon.
- L'alignement SP. La fréquence à laquelle l'étiquette de chaque annotateur coïncide avec le verdict étonnamment populaire, ce qui indique s'il est informé plutôt que simplement consensuel.
Configuration
truth_serum:
enabled: true
schema: sarcasm # scheme to collect predictions for (default: first radio)
min_annotators: 3 # predictions per item before a verdict is computed
# question: "What percentage of other annotators will choose the same label as you?"| Option | Par défaut | Description |
|---|---|---|
enabled | false | Interrupteur principal. |
schema | premier schéma radio | Le schéma dont les étiquettes reçoivent des prédictions de popularité. |
question | voir ci-dessus | Invite affichée au-dessus du curseur. |
min_annotators | 3 | Nombre minimal de prédictions par élément avant le calcul d'un verdict (plancher : 2). |
Notes méthodologiques
À lire avant de citer Truth Serum dans un article.
- Il s'agit de la variante simplifiée dite de prédiction sur sa propre réponse. Chaque annotateur prédit la popularité de l'étiquette qu'il a choisie, et non une distribution complète sur toutes les étiquettes. La popularité prédite d'une étiquette est la moyenne des prédictions de ceux qui l'ont choisie, sa surprise vaut
actual % − predicted %, et le verdict SP est l'étiquette votée la plus surprenante. - Les verdicts ne sont calculés qu'à partir de
min_annotatorsprédictions ou plus. Les verdicts à petit N sont bruités ; 3 est un plancher et non une recommandation, et 5 ou plus vaut mieux. - L'erreur de calibrage compare chaque prédiction à l'accord entre les autres annotateurs sur cet élément, en excluant l'annotateur lui-même.
- Les annotateurs peuvent revenir sur leur réponse. Le dernier couple (étiquette, prédiction) par instance l'emporte.
Données et API
Les prédictions sont écrites dans {output_annotation_dir}/truth_serum/predictions.jsonl (en ajout seul ; le dernier enregistrement par annotateur et par instance l'emporte).
| Point de terminaison | Méthode | Auth | Objet |
|---|---|---|---|
/truth_serum/api/predict | POST | session | Enregistre l'étiquette + le % prédit |
/truth_serum/api/mine | GET | session | La prédiction de cet annotateur (restauration du widget) |
/truth_serum/dashboard | GET | administrateur | Tableau de bord des verdicts et du calibrage |
/truth_serum/api/stats | GET | administrateur | Agrégats du tableau de bord |
/truth_serum/api/export | GET | administrateur | Export JSON complet (verdicts + prédictions brutes) |
Pour aller plus loin
- Psychométrie — des étiquettes avec probabilités a posteriori et intervalles de confiance
- Laboratoire de frontières de décision — le contrôle qualité par sondes contrefactuelles
- MACE — l'estimation de compétence, qui se combine avec la vue de calibrage de Truth Serum
- Agréger les étiquettes de la foule
- Documentation source