Skip to content

Como medir a concordância entre um juiz LLM e anotadores humanos

Verificar um LLM como juiz face a rótulos humanos: comparar o kappa juiz-humano com o kappa humano-humano, medir a calibração com ECE e pontuação de Brier, e testar o viés de posição.

Para decidir se pode confiar num juiz LLM, peça a pelo menos duas pessoas que rotulem uma amostra de itens sem verem as respostas do juiz, e depois compare a concordância do juiz com essas pessoas com a concordância das pessoas entre si. Um juiz cujo kappa de Cohen com os humanos se aproxima do kappa dos humanos entre si sai-se mais ou menos tão bem como outro anotador. Um que fique muito abaixo, não.

Um LLM como juiz é um modelo de linguagem a quem se pede que classifique saídas, normalmente segundo uma rubrica. O kappa de Cohen mede a concordância entre dois avaliadores, corrigida pela concordância esperada por acaso. Um juiz está calibrado quando a sua confiança corresponde à frequência com que acerta: dos veredictos que dá com 80% de confiança, cerca de 80% devem estar certos.

Porque é que a exatidão face a uma só pessoa não chega

A primeira verificação habitual é a exatidão. Rotula algumas centenas de itens e conta quantas vezes o juiz coincide. Esse número tem dois problemas. Trata os rótulos de uma pessoa como a verdade, erros incluídos, e não está corrigido para o acaso, pelo que um juiz que chama "útil" a todas as respostas tem boa pontuação num dataset em que a maioria das respostas é útil.

O kappa resolve o segundo problema. Um segundo anotador humano resolve o primeiro, porque o desacordo entre duas pessoas cuidadosas mostra quanto a própria tarefa permite, e não se pode exigir mais do que isso a um juiz.

Comparar o juiz com a concordância dos humanos entre si

Reporte três tipos de pares: humano com humano, juiz com humano, e juiz com juiz quando compara vários juízes. Se duas pessoas concordam com κ = 0,62, um juiz a 0,60 com cada uma delas comporta-se como um terceiro anotador, e pedir-lhe 0,9 é pedir mais do que a tarefa permite. Um juiz a 0,35 não concorda com as pessoas, por melhor que pareça a sua exatidão bruta.

Zheng et al. (2023) fizeram a mesma comparação no MT-Bench e concluíram que a concordância do GPT-4 com as preferências humanas era comparável à concordância entre humanos.

Com mais de dois humanos, ou com itens a que faltam alguns rótulos, reporte também o kappa de Fleiss ou o alfa de Krippendorff entre todos os avaliadores, além dos kappas por pares. Concordância entre anotadores explicada trata da escolha.

Manter os humanos às cegas

Se os anotadores virem a resposta do juiz, ancoram-se nela, e parte da concordância que mede é o juiz a concordar consigo próprio. Recolha os rótulos humanos sem as respostas do juiz no ecrã. O mesmo efeito faz subir a concordância quando os anotadores reveem pré-rótulos de um modelo. Veja Detetar pré-rótulos aceites sem revisão.

Verificar a confiança além dos veredictos

Um juiz pode concordar com as pessoas e mesmo assim ser confiante demais. Se a sua confiança decide que itens seguem para um humano, o excesso de confiança deixa os itens errados saltar a revisão.

Uma confiança que o modelo declara sobre si próprio é texto gerado como o resto da resposta. A amostragem dá uma confiança empírica: consulte o juiz k vezes por item com uma temperatura acima de zero, use a resposta mais frequente como veredicto e a proporção de amostras que deram essa resposta como confiança. Com temperatura 0, as k amostras são idênticas e todas as confianças valem 1,0.

O erro de calibração esperado (ECE) agrupa os veredictos por confiança e compara a confiança de cada grupo com a sua exatidão. A pontuação de Brier é a diferença quadrática média entre a confiança e o resultado. Um diagrama de fiabilidade representa os grupos face à diagonal que um juiz perfeitamente calibrado seguiria.

Testar o viés de posição em juízes por pares

Um juiz que compara duas respostas pode preferir a que aparece primeiro, ou a segunda, independentemente do conteúdo. Zheng et al. documentaram este viés de posição em juízes LLM. Corra cada par duas vezes com a ordem trocada. Um veredicto que muda quando a ordem muda foi decidido pela posição, e a proporção de pares que se mantêm coerentes deve constar do relatório ao lado da concordância. Veja Comparação de modelos por pares.

Escalas ordenadas

Numa classificação de 1 a 5, um juiz que diz 4 onde um humano diz 5 quase concordou. O kappa simples conta isso como 1 contra 5. Use o kappa ponderado ou o alfa de Krippendorff com uma métrica ordinal ou de intervalo, e reporte também o erro absoluto médio. Veja Escalas de classificação.

Quantos itens rotular

Um kappa calculado sobre 50 itens tem um intervalo de confiança largo, tão largo que dois juízes podem parecer diferentes quando a diferença é ruído. Reporte o intervalo com a estimativa, e dimensione a amostra humana antes de começar; potência estatística para estudos de anotação mostra como. Estratificar a amostra pelo rótulo do juiz mantém nela as classes raras.

Como fazer no Potato

A calibração de juízes do Potato corre cada juiz k vezes por item e guarda os seus rótulos num armazenamento separado, para que os anotadores nunca os vejam. Depois retira uma amostra aleatória ou estratificada para rotulagem humana às cegas e escreve um relatório.

yaml
annotation_schemes:
  - annotation_type: radio
    name: helpfulness
    description: "Is this response helpful?"
    labels: [helpful, unhelpful]
 
judge_calibration:
  enabled: true
  prompt: |
    You are an impartial expert annotator. Classify the response as exactly
    one of: helpful, unhelpful.
  models:
    - endpoint_type: ollama
      model: llama3.1:8b
      base_url: http://localhost:11434
      temperature: 0.7
  k_samples: 5
  sampling:
    strategy: stratified
    sample_size: 200
    seed: 42
  human:
    num_raters: 2
    gold: majority
  schemas: [helpfulness]

O relatório dá exatidão, precisão, revocação e F1 de cada modelo face ao rótulo de referência humano, e o κ de Cohen dividido em pares humano–modelo, modelo–modelo e humano–humano. Acrescenta o κ de Fleiss e o α de Krippendorff entre todos os avaliadores, o ECE com os intervalos de fiabilidade e a pontuação de Brier, e uma matriz de confusão por modelo. Para esquemas Likert, acrescenta o erro absoluto médio e o α ordinal. Desde a versão 2.9, o cartão de avaliação do juiz mostra também a coerência com posições trocadas, e os rótulos gerados podem ser lidos em /judge_calibration/results antes de a fase humana terminar.

Calibração de LLM como juiz lista todas as opções. Alinhamento do juiz trata de ajustar a rubrica de um único juiz face a um conjunto de referência existente.

Outras ferramentas

O LangSmith, o Langfuse e o Galileo permitem alinhar um juiz com correções humanas. O Langfuse calcula o κ de Cohen entre uma classificação humana e a de um juiz, duas séries de cada vez. Os planos pagos do Label Studio mostram onde anotadores e LLM concordam. Veja Ferramentas de avaliação de agentes de IA comparadas.

Perguntas frequentes

O que é um bom kappa entre um juiz LLM e humanos?

Não há um limiar fixo. Compare o kappa juiz-humano com o kappa entre dois humanos nos mesmos itens. Um juiz próximo do valor humano-humano concorda com as pessoas mais ou menos como outro anotador faria. A regra habitual para κ e α, 0,8 ou mais para confiar e de 0,67 a 0,8 para conclusões provisórias, descreve a tarefa no seu todo, e uma tarefa difícil limita o que qualquer juiz pode atingir.

Os anotadores devem ver a resposta do juiz LLM?

Não enquanto estiver a medir a concordância. Os anotadores que veem o veredicto do juiz tendem a ancorar-se nele, o que inflaciona a concordância aparente do juiz. Mostre o veredicto só depois de a amostra de calibração estar rotulada, se o chegar a mostrar.

Como verifico se um juiz LLM tem viés de posição?

Apresente cada par duas vezes, uma em cada ordem, e conte quantas vezes o veredicto muda com a ordem. Reporte a proporção de pares coerentes ao lado da concordância, e descarte ou repita os pares em que o veredicto muda.

O que é o erro de calibração esperado de um juiz LLM?

O ECE mede a distância entre a confiança de um juiz e a sua exatidão. Os veredictos são agrupados por confiança, e o ECE é a diferença média entre a confiança de cada grupo e a proporção dos seus veredictos que coincidiram com o rótulo humano, ponderada pelo tamanho do grupo. Um juiz bem calibrado tem um ECE perto de zero.

Leituras adicionais