Skip to content

Mesurer l'accord entre un juge LLM et des annotateurs humains

Vérifier un LLM juge par rapport à des étiquettes humaines : comparer le kappa juge-humain au kappa humain-humain, mesurer la calibration avec l'ECE et le score de Brier, et tester le biais de position.

Pour décider si l'on peut se fier à un juge LLM, faites étiqueter un échantillon d'éléments par au moins deux personnes qui ne voient pas les réponses du juge, puis comparez l'accord du juge avec ces personnes à l'accord des personnes entre elles. Un juge dont le kappa de Cohen avec les humains est proche du kappa des humains entre eux fait à peu près aussi bien qu'un annotateur de plus. Un juge nettement en dessous, non.

Un LLM juge est un modèle de langue invité à noter des sorties, généralement selon une grille. Le kappa de Cohen mesure l'accord entre deux évaluateurs, corrigé de l'accord attendu par hasard. Un juge est calibré quand sa confiance correspond à la fréquence à laquelle il a raison : sur les verdicts qu'il donne avec 80 % de confiance, environ 80 % devraient être justes.

Pourquoi l'exactitude face à une seule personne ne suffit pas

La première vérification habituelle est l'exactitude. Vous étiquetez vous-même quelques centaines d'éléments et vous comptez combien de fois le juge est d'accord. Ce chiffre pose deux problèmes. Il traite les étiquettes d'une personne comme la vérité, erreurs comprises, et il n'est pas corrigé du hasard, si bien qu'un juge qui qualifie toutes les réponses d'« utiles » obtient un bon score sur un jeu de données où la plupart des réponses sont utiles.

Le kappa règle le second problème. Un second annotateur humain règle le premier, car le désaccord entre deux personnes attentives montre ce que la tâche elle-même permet, et on ne peut pas exiger davantage d'un juge.

Comparer le juge à l'accord des humains entre eux

Rapportez trois types de paires : humain avec humain, juge avec humain, et juge avec juge si vous comparez plusieurs juges. Si deux personnes s'accordent à κ = 0,62, un juge à 0,60 avec chacune d'elles se comporte comme un troisième annotateur, et lui demander 0,9 revient à exiger plus que ce que la tâche permet. Un juge à 0,35 ne s'accorde pas avec les humains, aussi bonne que paraisse son exactitude brute.

Zheng et al. (2023) ont fait la même comparaison sur MT-Bench et ont trouvé l'accord de GPT-4 avec les préférences humaines comparable à l'accord entre humains.

Avec plus de deux humains, ou des éléments auxquels il manque des étiquettes, rapportez aussi le kappa de Fleiss ou l'alpha de Krippendorff sur l'ensemble des évaluateurs, en plus des kappas par paires. L'accord inter-annotateurs expliqué traite de ce choix.

Garder les humains à l'aveugle

Si les annotateurs voient la réponse du juge, ils s'y ancrent, et une partie de l'accord mesuré est alors le juge d'accord avec lui-même. Recueillez les étiquettes humaines sans les réponses du juge à l'écran. Le même effet fait monter l'accord quand des annotateurs relisent des pré-annotations produites par un modèle. Voir Détecter les pré-annotations validées sans relecture.

Vérifier la confiance autant que les verdicts

Un juge peut s'accorder avec les humains tout en étant trop sûr de lui. Si sa confiance décide quels éléments sont transmis à un humain, l'excès de confiance laisse passer les mauvais éléments sans relecture.

Une confiance que le modèle déclare sur lui-même est du texte généré comme le reste de sa réponse. L'échantillonnage en donne une empirique : interrogez le juge k fois par élément à une température supérieure à zéro, prenez la réponse la plus fréquente comme verdict et la part d'échantillons ayant donné cette réponse comme confiance. À température 0, les k échantillons sont identiques et chaque confiance vaut 1,0.

L'erreur de calibration attendue (ECE) regroupe les verdicts par niveau de confiance et compare la confiance de chaque groupe à son exactitude. Le score de Brier est l'écart quadratique moyen entre la confiance et le résultat. Un diagramme de fiabilité place les groupes face à la diagonale que suivrait un juge parfaitement calibré.

Tester le biais de position des juges par paires

Un juge qui compare deux réponses peut préférer celle qui vient en premier, ou en second, quel que soit leur contenu. Zheng et al. ont documenté ce biais de position chez les juges LLM. Soumettez chaque paire deux fois, en inversant l'ordre. Un verdict qui s'inverse avec l'ordre a été décidé par la position, et la part des paires qui restent cohérentes doit figurer dans le rapport à côté de l'accord. Voir Comparaison de modèles par paires.

Échelles ordonnées

Sur une note de 1 à 5, un juge qui dit 4 là où un humain dit 5 a presque été d'accord. Le kappa simple compte cela comme 1 contre 5. Utilisez un kappa pondéré ou l'alpha de Krippendorff avec une métrique ordinale ou d'intervalle, et rapportez aussi l'erreur absolue moyenne. Voir Échelles de notation.

Combien d'éléments étiqueter

Un kappa calculé sur 50 éléments a un intervalle de confiance large, assez large pour que deux juges paraissent différents alors que l'écart n'est que du bruit. Rapportez l'intervalle avec l'estimation, et dimensionnez l'échantillon humain avant de commencer ; la puissance statistique des études d'annotation montre comment. Stratifier l'échantillon selon l'étiquette du juge y garde les classes rares.

Dans Potato

La calibration des juges de Potato interroge chaque juge k fois par élément et range ses étiquettes dans un stockage séparé, de sorte que les annotateurs ne les voient jamais. Elle tire ensuite un échantillon aléatoire ou stratifié pour l'étiquetage humain à l'aveugle et produit un rapport.

yaml
annotation_schemes:
  - annotation_type: radio
    name: helpfulness
    description: "Is this response helpful?"
    labels: [helpful, unhelpful]
 
judge_calibration:
  enabled: true
  prompt: |
    You are an impartial expert annotator. Classify the response as exactly
    one of: helpful, unhelpful.
  models:
    - endpoint_type: ollama
      model: llama3.1:8b
      base_url: http://localhost:11434
      temperature: 0.7
  k_samples: 5
  sampling:
    strategy: stratified
    sample_size: 200
    seed: 42
  human:
    num_raters: 2
    gold: majority
  schemas: [helpfulness]

Le rapport donne l'exactitude, la précision, le rappel et le F1 de chaque modèle par rapport à l'étiquette de référence humaine, et le κ de Cohen réparti en paires humain–modèle, modèle–modèle et humain–humain. Il y ajoute le κ de Fleiss et l'α de Krippendorff sur l'ensemble des évaluateurs, l'ECE avec ses classes de fiabilité et le score de Brier, et une matrice de confusion par modèle. Pour les schémas Likert, il ajoute l'erreur absolue moyenne et l'α ordinal. Depuis la version 2.9, la fiche d'évaluation du juge affiche aussi la cohérence après inversion de position, et les étiquettes générées peuvent être lues à /judge_calibration/results avant la fin de la phase humaine.

Calibration du LLM juge liste toutes les options. Alignement du juge traite de l'ajustement de la grille d'un juge unique par rapport à un jeu de référence existant.

Autres outils

LangSmith, Langfuse et Galileo permettent chacun d'aligner un juge sur des corrections humaines. Langfuse calcule le κ de Cohen entre une note humaine et une note de juge, deux séries à la fois. Les offres payantes de Label Studio montrent où annotateurs et LLM s'accordent. Voir Comparatif des outils d'évaluation d'agents IA.

Questions fréquentes

Qu'est-ce qu'un bon kappa entre un juge LLM et des humains ?

Il n'y a pas de seuil fixe. Comparez le kappa juge-humain au kappa entre deux humains sur les mêmes éléments. Un juge proche du chiffre humain-humain s'accorde avec les humains à peu près comme le ferait un autre annotateur. La règle empirique habituelle pour κ et α, 0,8 et plus pour s'y fier et de 0,67 à 0,8 pour des conclusions provisoires, décrit la tâche dans son ensemble, et une tâche difficile plafonne ce que n'importe quel juge peut atteindre.

Les annotateurs doivent-ils voir la réponse du juge LLM ?

Pas tant que vous mesurez l'accord. Les annotateurs qui voient le verdict du juge ont tendance à s'y ancrer, ce qui gonfle l'accord apparent du juge. Ne montrez le verdict qu'une fois l'échantillon de calibration étiqueté, si vous le montrez.

Comment vérifier le biais de position d'un juge LLM ?

Présentez chaque paire deux fois, une fois dans chaque ordre, et comptez combien de fois le verdict change avec l'ordre. Rapportez la part de paires cohérentes à côté de l'accord, et écartez ou refaites les paires dont le verdict s'inverse.

Qu'est-ce que l'erreur de calibration attendue d'un juge LLM ?

L'ECE mesure l'écart entre la confiance d'un juge et son exactitude. Les verdicts sont regroupés par niveau de confiance, et l'ECE est l'écart moyen entre la confiance de chaque groupe et la part de ses verdicts qui ont rejoint l'étiquette humaine, pondéré par la taille du groupe. Un juge bien calibré a un ECE proche de zéro.

Pour aller plus loin