LLM 심판과 사람 어노테이터의 일치도를 측정하는 방법
LLM-as-a-Judge를 사람 레이블로 검증합니다. 심판-사람 kappa를 사람-사람 kappa와 비교하고, ECE와 Brier 점수로 캘리브레이션을 측정하고, 위치 편향을 점검합니다.
LLM 심판을 믿을지 판단하려면, 두 명 이상의 사람이 심판의 답을 보지 않은 채 샘플에 레이블을 붙이게 한 다음, 그 사람들과 심판의 일치도를 사람들 사이의 일치도와 비교하세요. 사람과의 Cohen kappa가 사람들 사이의 kappa에 가까운 심판은 어노테이터 한 명을 더 둔 것과 비슷한 수준입니다. 그보다 한참 낮은 심판은 그렇지 않습니다.
LLM-as-a-Judge는 출력물을 채점하도록 프롬프트를 받은 언어 모델로, 보통 루브릭에 따라 채점합니다. Cohen kappa는 두 평가자의 일치도를 우연히 기대되는 일치를 보정해서 측정합니다. 심판이 캘리브레이션되어 있다는 것은 확신도가 실제로 맞히는 빈도와 일치한다는 뜻입니다. 80% 확신으로 내린 판정 중 약 80%가 맞아야 합니다.
한 사람을 기준으로 한 정확도로는 부족한 이유
보통 가장 먼저 하는 확인은 정확도입니다. 직접 몇백 개 항목에 레이블을 붙이고 심판이 몇 번 일치하는지 셉니다. 이 수치에는 두 가지 문제가 있습니다. 한 사람의 레이블을 그 사람의 실수까지 포함해 정답으로 취급한다는 것, 그리고 우연을 보정하지 않는다는 것입니다. 그래서 대부분의 응답이 도움이 되는 데이터셋에서는 모든 응답을 "도움이 됨"이라고 판정하는 심판도 높은 점수를 받습니다.
두 번째 문제는 kappa가 해결합니다. 첫 번째 문제는 두 번째 사람 어노테이터가 해결합니다. 신중한 두 사람 사이의 불일치가 과제 자체가 허용하는 수준을 보여 주고, 심판에게 그 이상을 요구할 수는 없기 때문입니다.
심판을 사람들 사이의 일치도와 비교하기
세 종류의 쌍을 보고하세요. 사람과 사람, 심판과 사람, 그리고 여러 심판을 비교할 때는 심판과 심판입니다. 두 사람이 κ = 0.62로 일치한다면, 각 사람과 0.60으로 일치하는 심판은 세 번째 어노테이터처럼 행동하는 것이고, 0.9를 요구하는 것은 과제가 허용하는 것 이상을 요구하는 셈입니다. 0.35인 심판은 원시 정확도가 아무리 좋아 보여도 사람과 일치하지 않는 것입니다.
Zheng 외 (2023)는 MT-Bench에서 같은 비교를 했고, GPT-4와 사람 선호의 일치도가 사람들 사이의 일치도와 비슷하다는 것을 확인했습니다.
사람이 세 명 이상이거나 일부 레이블이 빠진 항목이 있다면, 쌍별 kappa와 함께 전체 평가자에 대한 Fleiss kappa나 Krippendorff alpha도 보고하세요. 어떤 것을 고를지는 어노테이터 간 일치도 설명에서 다룹니다.
사람은 블라인드로
어노테이터가 심판의 답을 볼 수 있으면 그 답에 끌려갑니다. 그러면 측정한 일치도의 일부는 심판이 자기 자신과 일치한 것에 불과해집니다. 사람 레이블은 화면에 심판의 답을 띄우지 않은 채 수집하세요. 어노테이터가 모델의 사전 레이블을 검토할 때도 같은 효과로 일치도가 올라갑니다. 검토 없이 통과시킨 사전 레이블 찾기를 참고하세요.
판정뿐 아니라 확신도도 확인하기
심판은 사람과 일치하면서도 과신할 수 있습니다. 심판의 확신도로 어떤 항목을 사람에게 넘길지 정한다면, 과신 때문에 잘못된 항목이 검토를 건너뛰게 됩니다.
모델이 스스로에 대해 밝히는 확신도는 답의 나머지와 마찬가지로 생성된 텍스트일 뿐입니다. 샘플링을 쓰면 경험적인 확신도를 얻을 수 있습니다. 온도를 0보다 크게 두고 항목마다 심판에게 k번 물은 뒤, 가장 많이 나온 답을 판정으로, 그 답을 낸 샘플의 비율을 확신도로 삼습니다. 온도가 0이면 k개 샘플이 모두 같아서 확신도는 늘 1.0이 됩니다.
기대 캘리브레이션 오차(ECE)는 판정을 확신도별로 묶고 각 묶음의 확신도를 정확도와 비교합니다. Brier 점수는 확신도와 결과의 차이를 제곱해 평균한 값입니다. 신뢰도 도표는 완벽하게 캘리브레이션된 심판이 따라갈 대각선에 대해 각 묶음을 그립니다.
쌍 비교 심판의 위치 편향 점검하기
두 응답을 비교하는 심판은 내용과 상관없이 먼저 나온 쪽이나 나중에 나온 쪽을 선호할 수 있습니다. Zheng 외는 LLM 심판의 이런 위치 편향을 기록했습니다. 각 쌍을 순서를 바꿔 두 번 실행하세요. 순서가 바뀔 때 뒤집히는 판정은 위치가 결정한 것이며, 일관성을 유지한 쌍의 비율은 일치도와 나란히 보고서에 들어가야 합니다. 모델 쌍 비교를 참고하세요.
순서가 있는 척도
1–5 척도에서 사람이 5를 준 곳에 심판이 4를 줬다면 거의 일치한 것입니다. 단순 kappa는 이를 1 대 5와 똑같이 셉니다. 가중 kappa나 순서형·구간형 거리를 쓰는 Krippendorff alpha를 사용하고, 평균 절대 오차도 함께 보고하세요. 평가 척도를 참고하세요.
몇 개 항목에 레이블을 붙일까
50개 항목으로 계산한 kappa는 신뢰 구간이 넓어서, 실제 차이가 잡음에 불과해도 두 심판이 달라 보일 정도입니다. 추정치와 함께 구간을 보고하고, 사람 샘플의 크기는 시작하기 전에 정하세요. 방법은 어노테이션 연구의 통계적 검정력에서 설명합니다. 심판의 레이블로 층화해 샘플을 뽑으면 드문 클래스도 샘플에 남습니다.
Potato에서 하는 방법
Potato의 심판 캘리브레이션은 각 심판을 항목마다 k번 실행하고, 그 레이블을 별도 저장소에 두어 어노테이터가 절대 보지 못하게 합니다. 그런 다음 블라인드 사람 레이블링을 위한 무작위 또는 층화 샘플을 뽑고 보고서를 작성합니다.
annotation_schemes:
- annotation_type: radio
name: helpfulness
description: "Is this response helpful?"
labels: [helpful, unhelpful]
judge_calibration:
enabled: true
prompt: |
You are an impartial expert annotator. Classify the response as exactly
one of: helpful, unhelpful.
models:
- endpoint_type: ollama
model: llama3.1:8b
base_url: http://localhost:11434
temperature: 0.7
k_samples: 5
sampling:
strategy: stratified
sample_size: 200
seed: 42
human:
num_raters: 2
gold: majority
schemas: [helpfulness]보고서에는 사람 골드 레이블에 대한 각 모델의 정확도, 정밀도, 재현율, F1과, 사람–모델, 모델–모델, 사람–사람 쌍으로 나눈 Cohen κ가 들어갑니다. 여기에 전체 평가자에 대한 Fleiss κ와 Krippendorff α, 신뢰도 구간이 포함된 ECE와 Brier 점수, 모델별 혼동 행렬이 더해집니다. Likert 스키마라면 평균 절대 오차와 순서형 α가 추가됩니다. 버전 2.9부터는 심판 평가 카드에 위치를 바꿨을 때의 일관성도 표시되며, 사람 단계가 끝나기 전에도 생성된 레이블을 /judge_calibration/results에서 볼 수 있습니다.
모든 옵션은 LLM-as-Judge 캘리브레이션에 정리되어 있습니다. 기존 골드 세트에 맞춰 심판 하나의 루브릭을 조정하는 방법은 심판 정렬에서 다룹니다.
다른 도구
LangSmith, Langfuse, Galileo는 모두 사람의 수정에 맞춰 심판을 정렬할 수 있게 합니다. Langfuse는 사람 점수와 심판 점수 사이의 Cohen κ를 한 번에 두 계열씩 계산합니다. Label Studio의 유료 플랜은 어노테이터와 LLM이 어디서 일치하는지 보여 줍니다. AI 에이전트 평가 도구 비교를 참고하세요.
자주 묻는 질문
LLM 심판과 사람 사이의 좋은 kappa는 얼마인가요?
정해진 임계값은 없습니다. 같은 항목에서 두 사람 사이의 kappa와 심판-사람 kappa를 비교하세요. 사람-사람 값에 가까운 심판은 어노테이터 한 명이 더 있는 것만큼 사람과 일치하는 것입니다. κ와 α에 흔히 쓰는 기준(0.8 이상이면 신뢰, 0.67–0.8이면 잠정적 결론)은 과제 전체를 설명하는 것이며, 어려운 과제는 어떤 심판이든 도달할 수 있는 수준에 상한을 둡니다.
어노테이터가 LLM 심판의 답을 봐야 하나요?
일치도를 측정하는 동안에는 보면 안 됩니다. 심판의 판정을 본 어노테이터는 그 판정에 끌려가기 쉽고, 그러면 심판의 겉보기 일치도가 부풀려집니다. 판정을 보여 주더라도 캘리브레이션 샘플에 레이블을 다 붙인 뒤에 보여 주세요.
LLM 심판의 위치 편향은 어떻게 점검하나요?
각 쌍을 순서를 바꿔 한 번씩, 모두 두 번 제시하고 순서에 따라 판정이 몇 번 바뀌는지 세세요. 일관된 쌍의 비율을 일치도와 나란히 보고하고, 판정이 뒤집힌 쌍은 버리거나 다시 실행하세요.
LLM 심판의 기대 캘리브레이션 오차란 무엇인가요?
ECE는 심판의 확신도와 정확도 사이의 차이를 측정합니다. 판정을 확신도별로 묶고, 각 묶음의 확신도와 그중 사람 레이블과 일치한 판정 비율의 차이를 묶음 크기로 가중 평균한 값이 ECE입니다. 캘리브레이션이 잘 된 심판은 ECE가 0에 가깝습니다.