Skip to content

Truth Serum

Pontuação por surpreendentemente popular na anotação. Uma micropergunta a mais por rótulo permite que o Potato supere o voto majoritário nos itens difíceis, sem nenhum rótulo-ouro em lugar algum.

Novo na v2.7.0

O voto majoritário falha exatamente onde a anotação é difícil: quando uma multidão confiante está errada e uma minoria informada está certa. O Truth Serum acrescenta uma micropergunta depois de cada rótulo.

Você escolheu Sarcastic. Que porcentagem dos outros anotadores vai escolher o mesmo rótulo que você?

Pontuação por predição de pares: “que porcentagem dos outros anotadores vai escolher o mesmo rótulo?”

Um controle deslizante, um clique. Essas previsões movem o princípio do surpreendentemente popular (Prelec 2004; Prelec, Seung & McCoy 2017, Nature): o rótulo cuja popularidade real mais supera a popularidade prevista é a melhor estimativa disponível da verdade, e nenhum rótulo-ouro é necessário para calculá-la.

A intuição é que quem sustenta uma visão minoritária correta em geral sabe que está em minoria, então a resposta dessa pessoa acaba mais popular do que qualquer um previu.

Até onde sabemos, o Potato é a primeira ferramenta de anotação a trazer pontuação por predição de pares.

O que você obtém

  1. Vereditos de item que superam o voto majoritário nos casos difíceis. A fila “Onde a multidão provavelmente erra”, no painel, lista toda instância cujo rótulo surpreendentemente popular difere do rótulo majoritário. Revise essas primeiro, ou encaminhe-as para adjudicação.
  2. Pontuações de calibração dos anotadores. O quanto a concordância prevista por cada anotador se distancia da concordância que ele de fato obteve dos colegas. Anotadores confiantes demais e mal calibrados aparecem sem nenhuma pergunta-ouro.
  3. Alinhamento com o SP. Com que frequência o rótulo de cada anotador coincide com o veredito surpreendentemente popular, o que serve de proxy para estar informado em vez de apenas concordar com os outros.

Configuração

yaml
truth_serum:
  enabled: true
  schema: sarcasm            # scheme to collect predictions for (default: first radio)
  min_annotators: 3          # predictions per item before a verdict is computed
  # question: "What percentage of other annotators will choose the same label as you?"
OpçãoPadrãoDescrição
enabledfalseChave mestra.
schemaprimeiro esquema radioDe qual esquema os rótulos recebem previsões de popularidade.
questionveja acimaEnunciado exibido acima do controle deslizante.
min_annotators3Mínimo de previsões por item antes de calcular um veredito (piso: 2).

Notas de método

Leia isto antes de citar o Truth Serum em um artigo.

  • Esta é a variante simplificada de previsão da própria resposta. Cada anotador prevê a popularidade do rótulo que escolheu, e não uma distribuição completa sobre todos os rótulos. A popularidade prevista de um rótulo é a média das previsões de quem o escolheu, sua surpresa é actual % − predicted % e o veredito SP é o rótulo votado mais surpreendente.
  • Os vereditos só são calculados com min_annotators previsões ou mais. Vereditos com N pequeno são ruidosos; 3 é um piso, não uma recomendação, e 5 ou mais é melhor.
  • O erro de calibração compara cada previsão com a concordância entre os outros anotadores naquele item, excluindo o próprio anotador.
  • Os anotadores podem revisar. Vale o último par (rótulo, previsão) de cada instância.

Dados e API

As previsões ficam em {output_annotation_dir}/truth_serum/predictions.jsonl (somente acréscimo; vale o registro mais recente por anotador e instância).

EndpointMétodoAutenticaçãoFinalidade
/truth_serum/api/predictPOSTsessãoRegistra rótulo + % prevista
/truth_serum/api/mineGETsessãoPrevisão deste anotador (restauração do widget)
/truth_serum/dashboardGETadministradorPainel de vereditos + calibração
/truth_serum/api/statsGETadministradorAgregados do painel
/truth_serum/api/exportGETadministradorExportação completa em JSON (vereditos + previsões brutas)

Leitura adicional