Controle de qualidade sem rótulos-ouro
Padrões-ouro são caros, vazam e só testam os casos que você lembrou de plantar. Duas alternativas, a pontuação por predição de pares e as sondagens contrafactuais de fronteira, pegam anotadores desatentos e diretrizes quebradas sem um único item plantado.
O jeito padrão de checar a qualidade da anotação é plantar itens cuja resposta você já conhece e ver quem erra. Funciona, mas é caro de montar, só testa os casos que você lembrou de plantar e anotadores experientes aprendem a reconhecer as plantações. Duas técnicas dão um sinal de qualidade sem nenhum item-ouro: a pontuação por predição de pares, que pede ao anotador para prever o que os outros vão dizer, e a sondagem contrafactual, que pergunta se um rótulo sobrevive a uma pequena edição. O Potato traz as duas, como Truth Serum e Laboratório de fronteiras de decisão (Boundary Lab).
Padrões-ouro e checagens de atenção são a resposta padrão para "como eu sei se meus anotadores estão prestando atenção", e eles merecem esse lugar. Mas têm três custos concretos.
Você precisa construí-los, o que significa tempo de especialista rotulando itens que você já entende. Eles cobrem apenas os modos de falha que você antecipou. E em qualquer tarefa de longa duração, os anotadores acabam reconhecendo os itens. Um item-ouro reaproveitado é um item-ouro que parou de medir qualquer coisa.
As duas técnicas abaixo contornam os três problemas, e nenhuma delas precisa de LLM.
Predição de pares: pergunte o que os outros vão dizer
Depois que o anotador escolhe um rótulo, o Truth Serum pergunta mais uma coisa:
Você escolheu Sarcastic. Que porcentagem dos outros anotadores vai escolher o mesmo rótulo que você?
Um controle deslizante. Um clique. Esse número extra faz um trabalho surpreendente.
O cartão de previsão do Truth Serum
Por que a previsão é informativa
O método é o princípio do surpreendentemente popular (Prelec, Seung & McCoy 2017, Nature; construído sobre o soro da verdade bayesiano de Prelec, 2004). A tese é que a melhor estimativa da verdade não é a resposta mais popular, e sim a resposta que é mais popular do que as pessoas previram que seria.
O raciocínio é o seguinte. Quem sustenta uma visão minoritária correta normalmente sabe que está em minoria. Essa pessoa consegue ver por que a maioria responderia de outro jeito, e diz isso quando você pede a previsão. Já quem sustenta um equívoco comum tende a supor que todo mundo concorda com ele. Então, quando uma resposta supera a própria popularidade prevista, essa diferença é evidência de que quem a escolheu sabe algo que a multidão não sabe.
O voto majoritário falha com mais força justamente onde uma multidão confiante está errada e uma minoria informada está certa. É para esse caso que a pontuação por surpreendentemente popular foi feita.
truth_serum:
enabled: true
schema: sarcasm
min_annotators: 5Até onde sabemos, o Potato é a primeira ferramenta de anotação a trazer pontuação por predição de pares.
O que você tira disso
Três coisas, nenhuma delas precisando de gabarito.
Uma fila de "onde a multidão provavelmente erra". Todo item cujo rótulo surpreendentemente popular difere do rótulo majoritário. São os itens que valem a atenção de um especialista, e em geral há bem menos deles do que você temia.
Pontuações de calibração por anotador. O quanto a concordância prevista por cada pessoa se distancia da concordância que ela de fato obteve. Alguém que prevê sistematicamente que 90% dos outros vão concordar com ele e sistematicamente consegue 55% está te dizendo algo sobre a própria autopercepção. E você descobriu isso sem plantar nada.
Alinhamento com o SP. Com que frequência o rótulo de cada anotador coincide com o veredito surpreendentemente popular, o que serve de proxy grosseiro para estar informado em vez de apenas concordar com os outros.
Uma ressalva antes de citar isso: esta é a variante simplificada de previsão da própria resposta, em que cada anotador prevê a popularidade do rótulo que escolheu, e não uma distribuição completa sobre todos os rótulos. E min_annotators: 3 é um piso, não uma recomendação. É a partir de cinco que os vereditos deixam de ser ruidosos.
Sondagens contrafactuais: pergunte se o rótulo sobrevive a uma edição
O Truth Serum acha itens em que a multidão errou. O Boundary Lab acha outra coisa: os pontos em que o seu livro de códigos é ambíguo, e os anotadores que não estão lendo de verdade.
No momento em que um rótulo é confirmado, o Potato mostra uma edição mínima do texto e pergunta se o rótulo ainda vale.
Você disse Polite. Isso sobreviveria a esta edição?
Uma sondagem do Boundary Lab
Responder custa um clique. Mas, porque você perguntou, a anotação comum passa a produzir três coisas que uma exportação simples de rótulos não entrega.
Conjuntos de contraste, como subproduto
Toda sondagem respondida é um par rotulado (original, contrafactual). Isso é um conjunto de contraste: dados aumentados com contrafactuais, do tipo que já se mostrou capaz de melhorar a robustez dos modelos (Gardner et al. 2020, Evaluating Models' Local Decision Boundaries via Contrast Sets; Kaushik et al. 2020).
Montar conjuntos de contraste normalmente é um esforço de anotação à parte e caro. Aqui eles caem da rotulagem que você já ia fazer de qualquer jeito.
boundary_probing:
enabled: true
schema: politeness
probes_per_item: 3
include_invariance: true
sources: [precomputed, llm, rules]A lista sources é uma cadeia de recuo. Você pode distribuir contrafactuais curados junto com seus dados, gerá-los com um LLM ou deixar a camada baseada em regras produzi-los a partir de transformações lexicais como inversão de negações, troca de intensificadores e marcadores de polidez. É essa última camada que faz o Boundary Lab funcionar sem nenhum LLM configurado, e é a razão de o recurso degradar de forma suave em vez de quebrar quando ninguém definiu uma chave de API.
Controle de qualidade invisível
Algumas sondagens são sondagens de invariância: paráfrases que preservam o significado. "Send me the slides before the meeting" ("Me manda os slides antes da reunião") vira "Before the meeting, send me the slides" ("Antes da reunião, me manda os slides").
Um anotador consistente nunca muda de rótulo diante dessas. Quem muda ou não está lendo com cuidado ou não tem uma ideia estável do que o rótulo significa. Nos dois casos você quer saber, e descobriu sem plantar um único item falso. A sondagem é indistinguível do trabalho comum, porque ela é trabalho comum.
O painel sinaliza os anotadores com taxa de manutenção abaixo de 60% nas sondagens de invariância.
Justificativas de fronteira
Quando um rótulo de fato muda, o anotador diz o que cruzou a linha: "o please suaviza a ordem". Essas justificativas se acumulam em um mapa de exatamente onde a sua diretriz está subespecificada, que é a matéria-prima de uma diretriz melhor.
O painel também informa a sensibilidade de fronteira por rótulo: das edições mínimas dirigidas a cada rótulo, que fração de fato o mudou. Um rótulo com 90% de taxa de mudança vive no fio da navalha e provavelmente precisa de uma definição mais clara. Um rótulo com 10% é robusto.
Qual dos dois usar?
Eles respondem perguntas diferentes, e se combinam.
| Truth Serum | Boundary Lab | |
|---|---|---|
| Encontra | Itens em que a multidão provavelmente errou | Diretrizes ambíguas; anotadores desatentos |
| Custo para o anotador | Um controle deslizante por item | Um clique por sondagem |
| Produz | Vereditos melhores, pontuações de calibração | Conjuntos de contraste, justificativas de fronteira |
| Precisa de LLM | Não | Não (camada baseada em regras) |
Se a sua preocupação é "o rótulo de consenso pode estar errado nos casos difíceis", comece pelo Truth Serum. Se for "acho que meu livro de códigos não é preciso o bastante, e não tenho certeza de que todo mundo está lendo", comece pelo Boundary Lab.
Nenhum dos dois substitui a psicometria, que diz quanta confiança ter em cada rótulo e quais anotadores pesar mais. Os três juntos dão um estudo em que a qualidade é medida continuamente em vez de conferida por amostragem, e em que nada dessa medição depende de um gabarito que você teve de construir antes.
Leitura adicional
- Truth Serum e Laboratório de fronteiras de decisão (Boundary Lab) — configuração completa
- Rótulos com barras de erro — posteriores de TRI e o detector de bugs no livro de códigos
- Padrões-ouro e checagens de atenção — a abordagem clássica, e quando ela ainda é a certa
- Controle de qualidade
- Como escrever diretrizes de anotação