Truth Serum
Pontuação por surpreendentemente popular na anotação. Uma micropergunta a mais por rótulo permite que o Potato supere o voto majoritário nos itens difíceis, sem nenhum rótulo-ouro em lugar algum.
Novo na v2.7.0
O voto majoritário falha exatamente onde a anotação é difícil: quando uma multidão confiante está errada e uma minoria informada está certa. O Truth Serum acrescenta uma micropergunta depois de cada rótulo.
Você escolheu Sarcastic. Que porcentagem dos outros anotadores vai escolher o mesmo rótulo que você?

Um controle deslizante, um clique. Essas previsões movem o princípio do surpreendentemente popular (Prelec 2004; Prelec, Seung & McCoy 2017, Nature): o rótulo cuja popularidade real mais supera a popularidade prevista é a melhor estimativa disponível da verdade, e nenhum rótulo-ouro é necessário para calculá-la.
A intuição é que quem sustenta uma visão minoritária correta em geral sabe que está em minoria, então a resposta dessa pessoa acaba mais popular do que qualquer um previu.
Até onde sabemos, o Potato é a primeira ferramenta de anotação a trazer pontuação por predição de pares.
O que você obtém
- Vereditos de item que superam o voto majoritário nos casos difíceis. A fila “Onde a multidão provavelmente erra”, no painel, lista toda instância cujo rótulo surpreendentemente popular difere do rótulo majoritário. Revise essas primeiro, ou encaminhe-as para adjudicação.
- Pontuações de calibração dos anotadores. O quanto a concordância prevista por cada anotador se distancia da concordância que ele de fato obteve dos colegas. Anotadores confiantes demais e mal calibrados aparecem sem nenhuma pergunta-ouro.
- Alinhamento com o SP. Com que frequência o rótulo de cada anotador coincide com o veredito surpreendentemente popular, o que serve de proxy para estar informado em vez de apenas concordar com os outros.
Configuração
truth_serum:
enabled: true
schema: sarcasm # scheme to collect predictions for (default: first radio)
min_annotators: 3 # predictions per item before a verdict is computed
# question: "What percentage of other annotators will choose the same label as you?"| Opção | Padrão | Descrição |
|---|---|---|
enabled | false | Chave mestra. |
schema | primeiro esquema radio | De qual esquema os rótulos recebem previsões de popularidade. |
question | veja acima | Enunciado exibido acima do controle deslizante. |
min_annotators | 3 | Mínimo de previsões por item antes de calcular um veredito (piso: 2). |
Notas de método
Leia isto antes de citar o Truth Serum em um artigo.
- Esta é a variante simplificada de previsão da própria resposta. Cada anotador prevê a popularidade do rótulo que escolheu, e não uma distribuição completa sobre todos os rótulos. A popularidade prevista de um rótulo é a média das previsões de quem o escolheu, sua surpresa é
actual % − predicted %e o veredito SP é o rótulo votado mais surpreendente. - Os vereditos só são calculados com
min_annotatorsprevisões ou mais. Vereditos com N pequeno são ruidosos; 3 é um piso, não uma recomendação, e 5 ou mais é melhor. - O erro de calibração compara cada previsão com a concordância entre os outros anotadores naquele item, excluindo o próprio anotador.
- Os anotadores podem revisar. Vale o último par (rótulo, previsão) de cada instância.
Dados e API
As previsões ficam em {output_annotation_dir}/truth_serum/predictions.jsonl (somente acréscimo; vale o registro mais recente por anotador e instância).
| Endpoint | Método | Autenticação | Finalidade |
|---|---|---|---|
/truth_serum/api/predict | POST | sessão | Registra rótulo + % prevista |
/truth_serum/api/mine | GET | sessão | Previsão deste anotador (restauração do widget) |
/truth_serum/dashboard | GET | administrador | Painel de vereditos + calibração |
/truth_serum/api/stats | GET | administrador | Agregados do painel |
/truth_serum/api/export | GET | administrador | Exportação completa em JSON (vereditos + previsões brutas) |
Leitura adicional
- Motor psicométrico — rótulos com posteriores e intervalos de confiança
- Laboratório de fronteiras de decisão (Boundary Lab) — controle de qualidade a partir de sondagens contrafactuais
- MACE — estimativa de competência, que se combina com a visão de calibração do Truth Serum
- Agregar rótulos da multidão
- Documentação de origem