Truth Serum
Punteggi basati sulla risposta sorprendentemente popolare per l'annotazione. Una sola micro-domanda in più per etichetta permette a Potato di battere il voto di maggioranza sugli elementi difficili, senza alcuna etichetta gold.
Novità della v2.7.0
Il voto di maggioranza fallisce esattamente dove l'annotazione è difficile: quando una folla sicura di sé sbaglia e una minoranza informata ha ragione. Truth Serum aggiunge una micro-domanda dopo ogni etichetta.
Hai scelto Sarcastic. Quale percentuale degli altri annotatori sceglierà la tua stessa etichetta?

Uno slider, un clic. Quelle previsioni alimentano il principio della risposta sorprendentemente popolare (Prelec 2004; Prelec, Seung & McCoy 2017, Nature): l'etichetta la cui popolarità effettiva eccede di più quella prevista è la migliore stima disponibile della verità, e per calcolarla non serve nessuna etichetta gold.
L'intuizione è che chi sostiene una posizione minoritaria corretta di solito sa di essere in minoranza, per cui la sua risposta finisce per risultare più popolare di quanto chiunque avesse previsto.
Per quanto ne sappiamo, Potato è il primo strumento di annotazione a offrire punteggi per peer prediction.
Che cosa ottieni
- Verdetti sugli elementi che battono il voto di maggioranza sui casi difficili. La coda «Dove è probabile che la folla sbagli» della dashboard elenca ogni istanza la cui etichetta sorprendentemente popolare differisce da quella di maggioranza. Rivedi prima queste, oppure mandale in aggiudicazione.
- Punteggi di calibrazione degli annotatori. Quanto l'accordo previsto da ciascun annotatore si discosta dall'accordo che ha davvero ottenuto dai colleghi. Gli annotatori troppo sicuri di sé e mal calibrati emergono senza bisogno di domande gold.
- Allineamento SP. Quanto spesso l'etichetta di ciascun annotatore coincide con il verdetto sorprendentemente popolare, che è un indicatore dell'essere informati più che semplicemente accomodanti.
Configurazione
truth_serum:
enabled: true
schema: sarcasm # scheme to collect predictions for (default: first radio)
min_annotators: 3 # predictions per item before a verdict is computed
# question: "What percentage of other annotators will choose the same label as you?"| Opzione | Predefinito | Descrizione |
|---|---|---|
enabled | false | Interruttore principale. |
schema | primo schema radio | Di quale schema le etichette ricevono le previsioni di popolarità. |
question | vedi sopra | Domanda mostrata sopra lo slider. |
min_annotators | 3 | Previsioni minime per elemento prima che venga calcolato un verdetto (minimo assoluto: 2). |
Note di metodo
Leggile prima di citare Truth Serum in un articolo.
- Questa è la variante semplificata con previsione della propria risposta. Ogni annotatore prevede la popolarità dell'etichetta che ha scelto, invece di una distribuzione completa su tutte le etichette. La popolarità prevista di un'etichetta è la media delle previsioni di chi l'ha scelta, la sua sorpresa è
actual % − predicted %e il verdetto SP è l'etichetta votata più sorprendente. - I verdetti vengono calcolati solo a partire da
min_annotatorsprevisioni. I verdetti con N piccolo sono rumorosi; 3 è un minimo assoluto più che una raccomandazione, e da 5 in su è meglio. - L'errore di calibrazione confronta ogni previsione con l'accordo tra gli altri annotatori su quell'elemento, escludendo l'annotatore stesso.
- Gli annotatori possono correggersi. Per ogni istanza vince l'ultima coppia (etichetta, previsione).
Dati e API
Le previsioni vengono salvate in {output_annotation_dir}/truth_serum/predictions.jsonl (solo in append; per ogni annotatore e istanza vince il record più recente).
| Endpoint | Metodo | Auth | Scopo |
|---|---|---|---|
/truth_serum/api/predict | POST | sessione | Registra etichetta + % prevista |
/truth_serum/api/mine | GET | sessione | La previsione di questo annotatore (ripristino del widget) |
/truth_serum/dashboard | GET | amministratore | Dashboard dei verdetti e della calibrazione |
/truth_serum/api/stats | GET | amministratore | Aggregati della dashboard |
/truth_serum/api/export | GET | amministratore | Esportazione JSON completa (verdetti + previsioni grezze) |
Ulteriori letture
- Psicometria — etichette con distribuzioni a posteriori e intervalli di confidenza
- Laboratorio dei confini di decisione (Boundary Lab) — controllo qualità a partire da sonde controfattuali
- MACE — stima della competenza, che si combina con la vista di calibrazione di Truth Serum
- Aggregare le etichette della folla
- Documentazione sorgente