Motor psicométrico
Teoria de resposta ao item aplicada à anotação. Cada rótulo recebe uma probabilidade posterior e um intervalo de confiança em vez de um voto majoritário seco, e o modelo não precisa de rótulos-ouro nem de LLM para ser ajustado.
Novo na v2.7.0
O Potato pode tratar seu estudo de anotação pelo que ele de fato é: um instrumento de medição. A camada psicométrica ajusta um modelo de teoria de resposta ao item (TRI) ao vivo, conforme as anotações chegam, estimando em conjunto o rótulo verdadeiro de cada item como probabilidade, a habilidade de cada anotador com erro-padrão, a dificuldade de cada item e um diagnóstico de discriminação por item que sinaliza prováveis bugs no livro de códigos.
Não são necessários rótulos-ouro, e nenhum LLM entra na conta. O modelo (uma generalização multiclasse do GLAD, Whitehill et al. 2009) deriva tudo do próprio padrão de concordância, do mesmo jeito que uma prova padronizada aprende quais questões são difíceis sem ninguém precisar declarar isso. Os ajustes são determinísticos e levam milissegundos na escala de um estudo de anotação.

Configuração
# Adaptive routing is opt-in via the standard assignment strategy key.
# Omit this line to keep your existing strategy and use psychometrics
# as a pure analytics layer.
assignment_strategy: psychometric
# Give items a redundancy target so early-stopped items translate into
# concrete saved judgments on the dashboard.
num_annotators_per_item: 4
psychometrics:
enabled: true
schema: sarcasm # scheme to model; default: first radio/likert scheme
refit_interval: 5 # refit after this many new labels (fits are ~ms)
min_observations: 20 # cold-start gate before adaptive routing engages
min_annotators_per_item: 2 # never early-stop an item below this many annotators
confidence_threshold: 0.95 # posterior at which an item counts as resolved
cost_per_judgment: 0.08 # optional: expresses savings in currency
discrimination_flag_threshold: -0.2 # codebook-bug flag sensitivityOs esquemas suportados são categóricos de escolha única: radio e likert (os pontos da likert são tratados como categorias nominais). Esquemas de múltipla seleção não são modelados.
Rótulos com barras de erro
Em vez de sarcastic (2 of 3 votes), a exportação traz sarcastic, p = 0.94 [0.88 – 0.97]. A probabilidade é a posterior do modelo, que pesa quem votou e não apenas quantos votaram, e o intervalo é uma faixa de sensibilidade de ±1 erro-padrão sobre as estimativas de habilidade.
Rio abaixo, você pode treinar com rótulos suaves, filtrar conjuntos de avaliação para itens de alta confiança ou tratar itens de baixa probabilidade como genuinamente ambíguos em vez de ruído. Veja rótulo suave para a abordagem complementar, que coleta distribuições diretamente dos anotadores.
Habilidade do anotador, apresentada com honestidade
A habilidade θ é estimada a partir dos padrões de concordância. O valor 1.0 é a priori de um anotador novo, 0 significa que os rótulos dele não carregam informação e valores negativos significam erro sistemático. Toda estimativa vem acompanhada de um erro-padrão: quem tem 12 rótulos tem uma barra larga, e o painel diz isso.
Não tome decisões sobre pessoas com base em uma barra larga. Os erros-padrão são aproximados (informação de Fisher na moda) e um pouco otimistas por construção.
O detector de bugs no livro de códigos
A dificuldade do item é estimada junto com a habilidade, mas o sinal mais útil é a discriminação: a correlação entre a habilidade do anotador e o acerto da resposta em cada item.
Quando a discriminação é fortemente negativa, ou seja, quando são os seus melhores anotadores que discordam do consenso da multidão, em geral a diretriz é que está errada ou ambígua para aquele item, e não os anotadores. O painel reúne esses casos em “Prováveis bugs no livro de códigos”. Corrija as instruções e depois revisite. As Salas multijogador são o lugar aonde as equipes normalmente vão para resolvê-los.
Encaminhamento adaptativo
Com assignment_strategy: psychometric, quando um anotador pede trabalho os itens restantes são ordenados pelo ganho de informação esperado exato de um passo daquele anotador rotular aquele item. Itens de alta incerteza vão primeiro para anotadores de alta habilidade, e itens cuja posterior já ultrapassa confidence_threshold (com pelo menos min_annotators_per_item anotadores) param de consumir orçamento. Em comparação com um desenho de N fixo por item, os julgamentos economizados são contabilizados no painel e precificados se você definir cost_per_judgment.
Duas observações operacionais:
- Partida a frio. Enquanto não existirem
min_observationsrótulos, a atribuição volta a ser aleatória, porque o modelo precisa de anotadores sobrepostos antes de conseguir separar habilidade de dificuldade. Nessa fase, o painel mostra um medidor de aquecimento. - Lotes. A atribuição acontece quando a fila de um usuário é reabastecida. A ordenação é mais fresca quando as filas são curtas; lotes muito grandes por usuário diluem a adaptatividade.
Análise de poder antes de gastar
Todo projeto de anotação chuta a resposta para “quantos anotadores por item?”. O planejador de estudos responde isso com uma simulação de Monte Carlo com semente:
python -m potato.psychometrics.design --items 500 --accuracy 0.75 \
--classes 3 --target-ci 0.10 --cost 0.08ann/item alpha 95% interval width majority acc judgments cost
2 0.392 [ 0.330, 0.439] 0.109 0.751 1000 80.00
3 0.388 [ 0.338, 0.431] 0.093 0.864 1500 120.00 <- recommended
A recomendação é a menor redundância cujo intervalo de 95% sobre o α de Krippendorff seja mais estreito que --target-ci, isto é, o desenho mais barato que ainda entrega uma estimativa de concordância defensavelmente precisa. O melhor jeito de medir a entrada --accuracy é com um piloto pequeno. A mesma análise está disponível no painel e como API de administração (GET /psychometrics/api/design).
Você também pode rodá-la interativamente no navegador com a calculadora de poder para anotação.
Endpoints
Todos os endpoints exigem acesso de administrador (RBAC VIEW_ADMIN_DASHBOARD; o modo debug e a chave compartilhada de API de administração passam).
| Endpoint | Finalidade |
|---|---|
GET /psychometrics/dashboard | Painel ao vivo |
GET /psychometrics/api/stats | Agregados do painel (força um novo ajuste) |
GET /psychometrics/api/export | Exportação enriquecida: posteriores, faixas, habilidades |
GET /psychometrics/api/design | Análise de poder |
Como isso se relaciona com o MACE
O Potato também traz o MACE, que estima a competência dos anotadores e os rótulos previstos como análise a posteriori. Os dois são primos, vindos da mesma literatura, com trabalhos diferentes.
| MACE | Psicometria | |
|---|---|---|
| Modelo do anotador | competência do tipo conhecedor vs. adivinhador | habilidade contínua com erros-padrão |
| Modelo do item | nenhum | dificuldade + discriminação (sinalizadores de bug no livro de códigos) |
| Quando roda | análise em lote depois de N anotações | ao vivo, dentro do laço de atribuição |
| Dirige a atribuição | não | sim, por encaminhamento por ganho de informação e parada antecipada |
| Incerteza sobre os rótulos | entropia | probabilidade posterior + intervalo de sensibilidade |
| Planejamento pré-estudo | não | análise de poder por Monte Carlo |
Use o MACE para uma leitura rápida de competência em qualquer esquema categórico (ele cobre também multiselect). Use a psicometria quando quiser medição sensível à dificuldade que age sobre o estudo enquanto ele roda.
Solução de problemas
- O painel fica “aquecendo” para sempre. O modelo precisa de pelo menos dois rótulos distintos e de anotadores sobrepostos. Com um único anotador ou com rótulos unânimes, o ajuste é degenerado por construção. Adicione anotadores ou reduza
min_observations. assignment_strategy: psychometricestá definido, mas o encaminhamento parece aleatório. Isso é o recuo da partida a frio. Confira o medidor de aquecimento emin_observations.- As habilidades estão todas perto de 1.0, com barras enormes. Ainda não há sobreposição suficiente. As habilidades se separam conforme os anotadores acumulam itens em comum.
- 404 em
/psychometrics/.... Falta o blocopsychometrics.enabled: truena configuração.
Leitura adicional
- Truth Serum — pontuação por predição de pares, o outro sinal de qualidade que dispensa rótulos-ouro
- Estratégias de atribuição de tarefas
- Concordância entre anotadores
- Quantos anotadores você precisa?
- Documentação de origem