Skip to content
Guides7 min read

Juzgar al juez: el razonamiento humano y el del modelo, uno al lado del otro

Un juez LLM solo es tan fiable como las etiquetas humanas contra las que lo validaste. Pon la cadena de razonamiento de una persona junto a la de un modelo sobre el mismo elemento, y contrasta tu juez con etiquetas que llevan su propio intervalo de confianza.

Potato Team

Todo el que evalúa LLM a escala acaba usando un LLM como juez, y todo el mundo acaba preguntándose si se puede confiar en él. La respuesta habitual es contrastarlo con etiquetas humanas. Pero esa comprobación vale lo que valgan las etiquetas humanas, y «el juez coincide con los humanos» es una afirmación floja si los humanos discreparon entre sí y nadie apuntó por cuánto. De eso va esto: de cerrar ese hueco midiendo cómo razona un modelo, midiendo cómo razona una persona y comparando ambas cosas con honestidad.

Potato 2.7 se organiza en torno a una sola idea: una herramienta de anotación debería medir cómo se tomó un juicio, y no limitarse a registrarlo. Lo interesante es que eso vale para los dos tipos de juez.

El problema de validar a un juez

El flujo de trabajo estándar es razonable. Tienes una tarea demasiado grande para etiquetarla a mano, así que le pides a un modelo que la puntúe. Antes de fiarte de las puntuaciones, coges una muestra, haces que la etiqueten personas y mides el acuerdo entre el juez y esas personas. Si la κ de Cohen es lo bastante alta, sale a producción.

El punto flojo es el último paso. Esa κ compara tu juez contra una etiqueta humana, normalmente un voto mayoritario sobre dos o tres anotadores. Y un voto mayoritario es una estimación puntual sin barra de error. Dice «sarcastic» con exactamente la misma confianza tanto si los tres anotadores coincidieron al instante como si dos se impusieron a un tercero tras una discusión larga.

Así que cuando informas de que tu juez coincide con los humanos con κ = 0,71, estás informando del acuerdo con un número cuya propia incertidumbre nunca mediste. Si las etiquetas humanas de los elementos difíciles se parecen a lanzar una moneda, entonces la κ sobre esos elementos está midiendo sobre todo ruido, y ninguna cantidad de ingeniería de prompts la va a mover.

Ya escribimos antes sobre la mecánica de la calibración del juez y de la alineación juez ↔ humano. Lo que añade la 2.7 es la otra mitad: hacer que el lado humano de esa comparación lleve su propia incertidumbre.

Primero, ponle barras de error a las etiquetas humanas

El motor psicométrico ajusta un modelo de teoría de respuesta al ítem a tus anotaciones humanas y da cada etiqueta como una posterior con su intervalo (sarcastic, p = 0.94 [0.88 – 0.97]), ponderando quién votó y no solo cuántos.

Truth Serum añade la puntuación por predicción entre pares, que marca los elementos en los que la mayoría probablemente se equivoca aunque estuviera convencida.

Ahora la comparación con el juez cambia de forma. En lugar de

el juez coincide con la etiqueta mayoritaria en el 71 % de los elementos

puedes decir

el juez coincide con la posterior humana en el 94 % de los elementos donde la etiqueta humana es firme (p > 0.9), y en el 52 % de aquellos donde no lo es. Esos elementos de baja confianza son el 18 % del conjunto.

La segunda afirmación es accionable de un modo en que la primera no lo es. Te dice que tu juez va bien en los casos fáciles y no es fiable en los difíciles, y te dice qué proporción de tus datos es difícil. También te dice algo incómodo y útil: en los elementos genuinamente ambiguos, puede que no haya ninguna verdad de referencia con la que el juez pueda coincidir, y perseguir allí una κ más alta es perseguir ruido.

Para eso está el panel de alineación juez ↔ humano, y por eso las funciones de proceso humano y las de evaluación de agentes son la misma versión y no dos.

Dos cadenas de razonamiento sobre el mismo elemento

La otra mitad de la comparación es el razonamiento en sí.

El modo Think-Aloud registra cómo razona una persona hasta llegar a una etiqueta. El anotador habla mientras trabaja; el paso de voz a texto se ejecuta en local; la transcripción se guarda literal, sin resumir, porque parafrasear un protocolo de pensamiento en voz alta destruye justo aquello que estabas recogiendo.

Una transcripción literal del razonamiento hablado con una etiqueta detectada por vozLa cadena de razonamiento humana, capturada al pie de la letra

La anotación de recompensa de proceso registra cómo razona un modelo. La cadena de razonamiento del modelo se segmenta en pasos, y cada paso recibe una señal de recompensa buena/mala/neutra, que es la señal de entrenamiento de un modelo de recompensa de proceso.

yaml
annotation_schemes:
  - annotation_type: process_reward
    name: cot_review
    description: "Rate each step of the model's reasoning."
    steps_key: reasoning_steps

El mismo elemento. Dos cadenas de razonamiento. Ponlas una al lado de la otra.

Qué aprendes en realidad de la comparación

El uso obvio es encontrar dónde razona el modelo distinto de la persona, y conviene ser concreto sobre por qué eso importa.

La puntuación de la respuesta final no distingue entre un modelo que acertó por el motivo correcto y uno que acertó por el motivo equivocado. En una tarea de sarcasmo, una persona podría decir «aquí el trabajo lo hace el "thanks so much". Nadie te da las gracias con tanto énfasis por un retraso de dos días» ("the 'thanks so much' is doing the work here. Nobody thanks you that hard for a two-day delay."). Un modelo podría llegar a la misma etiqueta porque el texto lleva un signo de exclamación. Los dos se marcan como correctos. Solo uno de ellos va a generalizar.

Eso no lo detectas a partir de las etiquetas. Sí lo detectas a partir del razonamiento, y por eso tener las dos cosas compensa el esfuerzo.

El segundo uso son los datos de entrenamiento. Los pasos donde el razonamiento humano y el del modelo divergen son, casi por definición, los pasos con más señal de un dataset de recompensa de proceso. Son los sitios donde el proceso del modelo está mal de una forma que su salida no revela.

Una limitación honesta. Potato te da las dos superficies de captura y las pone una al lado de la otra. No calcula una métrica automática de similitud entre la cadena de razonamiento de una persona y la de un modelo, y hemos decidido a propósito no incluir ninguna. Qué significa que «estas dos trazas de razonamiento coinciden» es una pregunta de investigación abierta, y un número inventado por nosotros sería peor que ningún número, porque parecería autorizado y significaría muy poco. Lo que importa es el artefacto; la métrica la defines tú.

Ponerlo todo junto

Una cadena de evaluación defendible en la 2.7 tiene más o menos esta pinta.

  1. Etiqueta una muestra con personas, con la psicometría activada. Cada etiqueta recibe una posterior y un intervalo. Los elementos ambiguos quedan identificados como ambiguos en vez de mal etiquetados sin que nadie se entere.
  2. Ejecuta Truth Serum para pillar los elementos en los que una mayoría convencida probablemente se equivoca.
  3. Arregla la directriz allí donde el detector de fallos del manual de codificación marque discriminación negativa, idealmente en una sala de normalización donde puedas ver moverse el acuerdo mientras converges.
  4. Calibra el juez contra esas etiquetas, e informa de la alineación condicionada a la confianza humana en lugar de como un único número.
  5. Revisa el razonamiento, no solo el veredicto, en los elementos donde el juez y las personas discrepan.

Cada paso es YAML, autoalojado y gratuito. Los pasos 1 a 3 no necesitan ningún LLM.

Nada de esto hace fiable a un juez LLM por sí solo. Lo que hace es convertir la afirmación de fiabilidad en algo real: un enunciado con un intervalo encima, contra etiquetas humanas que también tienen intervalos, sobre elementos de cuya dificultad puedes decir algo honesto.

Ese listón es más bajo que «nuestro juez está alineado con los valores humanos», y mucho más útil.

Lecturas adicionales