Cómo medir el acuerdo entre un juez LLM y anotadores humanos
Contrasta un LLM como juez con etiquetas humanas: compara la kappa juez-humano con la kappa humano-humano, mide la calibración con ECE y la puntuación de Brier, y comprueba el sesgo de posición.
Para decidir si puedes fiarte de un juez LLM, haz que al menos dos personas etiqueten una muestra de ítems sin ver las respuestas del juez, y compara después el acuerdo del juez con esas personas con el acuerdo de las personas entre sí. Un juez cuya kappa de Cohen con los humanos se acerca a la kappa de los humanos entre sí lo hace más o menos tan bien como otro anotador. Uno muy por debajo, no.
Un LLM como juez es un modelo de lenguaje al que se le pide que califique salidas, normalmente con una rúbrica. La kappa de Cohen mide el acuerdo entre dos evaluadores, corregido por el acuerdo esperable por azar. Un juez está calibrado cuando su confianza coincide con la frecuencia con la que acierta: de los veredictos que da con un 80 % de confianza, alrededor del 80 % deberían ser correctos.
Por qué no basta la exactitud frente a una sola persona
La primera comprobación habitual es la exactitud. Etiquetas tú mismo unos cientos de ítems y cuentas cuántas veces coincide el juez. Esa cifra tiene dos problemas. Trata las etiquetas de una persona como la verdad, errores incluidos, y no está corregida por azar, así que un juez que califica todas las respuestas como "útil" puntúa bien en un dataset en el que la mayoría de las respuestas son útiles.
La kappa resuelve el segundo problema. Un segundo anotador humano resuelve el primero, porque el desacuerdo entre dos personas cuidadosas muestra cuánto permite la propia tarea, y a un juez no se le puede exigir más que eso.
Comparar al juez con el acuerdo de los humanos entre sí
Informa de tres tipos de pares: humano con humano, juez con humano y juez con juez cuando compares varios jueces. Si dos personas coinciden con κ = 0,62, un juez con 0,60 frente a cada una se comporta como un tercer anotador, y pedirle 0,9 es pedir más de lo que la tarea permite. Un juez en 0,35 no coincide con las personas, por buena que parezca su exactitud bruta.
Zheng et al. (2023) hicieron la misma comparación en MT-Bench y encontraron que el acuerdo de GPT-4 con las preferencias humanas era comparable al acuerdo entre humanos.
Con más de dos humanos, o con ítems a los que les faltan etiquetas, informa de la kappa de Fleiss o del alfa de Krippendorff entre todos los evaluadores además de las kappas por pares. El acuerdo entre anotadores, explicado trata la elección.
Mantén a los humanos a ciegas
Si los anotadores ven la respuesta del juez, se anclan en ella, y parte del acuerdo que mides es el juez coincidiendo consigo mismo. Recoge las etiquetas humanas sin las respuestas del juez en pantalla. El mismo efecto sube el acuerdo cuando los anotadores revisan preetiquetas de un modelo. Consulta Detectar preetiquetas aceptadas sin revisar.
Comprobar la confianza además de los veredictos
Un juez puede coincidir con las personas y aun así ser demasiado confiado. Si su confianza decide qué ítems pasan a un humano, el exceso de confianza deja que los ítems equivocados se salten la revisión.
Una confianza que el modelo declara sobre sí mismo es texto generado como el resto de su respuesta. El muestreo da una confianza empírica: consulta al juez k veces por ítem con una temperatura mayor que cero, toma la respuesta más frecuente como su veredicto, y la proporción de muestras que dieron esa respuesta como su confianza. Con temperatura 0, las k muestras son idénticas y todas las confianzas valen 1,0.
El error de calibración esperado (ECE) agrupa los veredictos por confianza y compara la confianza de cada grupo con su exactitud. La puntuación de Brier es la diferencia cuadrática media entre la confianza y el resultado. Un diagrama de fiabilidad representa los grupos frente a la diagonal que seguiría un juez perfectamente calibrado.
Probar el sesgo de posición en jueces por pares
Un juez que compara dos respuestas puede preferir la que aparece primero, o la segunda, independientemente de su contenido. Zheng et al. documentaron este sesgo de posición en los jueces LLM. Ejecuta cada par dos veces con el orden intercambiado. Un veredicto que cambia cuando cambia el orden lo decidió la posición, y la proporción de pares que se mantienen coherentes debe figurar en el informe junto al acuerdo. Consulta Comparación de modelos por pares.
Escalas ordenadas
En una valoración de 1 a 5, un juez que dice 4 donde un humano dice 5 casi ha coincidido. La kappa simple lo cuenta igual que 1 frente a 5. Usa la kappa ponderada o el alfa de Krippendorff con una métrica ordinal o de intervalo, e informa también del error absoluto medio. Consulta Escalas de valoración.
Cuántos ítems etiquetar
Una kappa calculada sobre 50 ítems tiene un intervalo de confianza amplio, tanto que dos jueces pueden parecer distintos cuando la diferencia es ruido. Informa del intervalo junto a la estimación, y fija el tamaño de la muestra humana antes de empezar; potencia estadística para estudios de anotación explica cómo. Estratificar la muestra por la etiqueta del juez mantiene en ella las clases poco frecuentes.
Cómo hacerlo en Potato
La calibración de jueces de Potato ejecuta cada juez k veces por ítem y guarda sus etiquetas en un almacén aparte, de modo que los anotadores nunca las ven. Después toma una muestra aleatoria o estratificada para el etiquetado humano a ciegas y genera un informe.
annotation_schemes:
- annotation_type: radio
name: helpfulness
description: "Is this response helpful?"
labels: [helpful, unhelpful]
judge_calibration:
enabled: true
prompt: |
You are an impartial expert annotator. Classify the response as exactly
one of: helpful, unhelpful.
models:
- endpoint_type: ollama
model: llama3.1:8b
base_url: http://localhost:11434
temperature: 0.7
k_samples: 5
sampling:
strategy: stratified
sample_size: 200
seed: 42
human:
num_raters: 2
gold: majority
schemas: [helpfulness]El informe da exactitud, precisión, exhaustividad y F1 de cada modelo frente a la etiqueta de referencia humana, y la κ de Cohen dividida en pares humano–modelo, modelo–modelo y humano–humano. Añade la κ de Fleiss y el α de Krippendorff entre todos los evaluadores, el ECE con sus intervalos de fiabilidad y la puntuación de Brier, y una matriz de confusión por modelo. En los esquemas Likert añade el error absoluto medio y el α ordinal. Desde la versión 2.9, la tarjeta de evaluación del juez muestra también la coherencia al intercambiar la posición, y las etiquetas generadas pueden leerse en /judge_calibration/results antes de que termine la fase humana.
Calibración de LLM como juez enumera todas las opciones. Alineación del juez trata el ajuste de la rúbrica de un único juez frente a un conjunto de referencia existente.
Otras herramientas
LangSmith, Langfuse y Galileo permiten alinear un juez con las correcciones humanas. Langfuse calcula la κ de Cohen entre una puntuación humana y la de un juez, de dos series en dos series. Los planes de pago de Label Studio muestran dónde coinciden anotadores y LLM. Consulta Herramientas de evaluación de agentes de IA comparadas.
Preguntas frecuentes
¿Qué es una buena kappa entre un juez LLM y humanos?
No hay un umbral fijo. Compara la kappa juez-humano con la kappa entre dos humanos sobre los mismos ítems. Un juez cerca de la cifra humano-humano coincide con las personas más o menos como lo haría otro anotador. La regla orientativa habitual para κ y α, 0,8 o más para fiarse y de 0,67 a 0,8 para conclusiones provisionales, describe la tarea en su conjunto, y una tarea difícil pone un techo a lo que cualquier juez puede alcanzar.
¿Deben ver los anotadores la respuesta del juez LLM?
No mientras midas el acuerdo. Los anotadores que ven el veredicto del juez tienden a anclarse en él, lo que infla el acuerdo aparente del juez. Muestra el veredicto solo cuando la muestra de calibración esté etiquetada, si es que lo muestras.
¿Cómo compruebo si un juez LLM tiene sesgo de posición?
Presenta cada par dos veces, una en cada orden, y cuenta cuántas veces cambia el veredicto con el orden. Informa de la proporción de pares coherentes junto al acuerdo, y descarta o repite los pares en los que el veredicto cambia.
¿Qué es el error de calibración esperado de un juez LLM?
El ECE mide la distancia entre la confianza de un juez y su exactitud. Los veredictos se agrupan por confianza, y el ECE es la diferencia media entre la confianza de cada grupo y la proporción de sus veredictos que coincidieron con la etiqueta humana, ponderada por el tamaño del grupo. Un juez bien calibrado tiene un ECE cercano a cero.