Skip to content

如何衡量 LLM 評審者與人類標註者之間的一致性

用人工標籤檢驗 LLM 評審:把評審與人的 kappa 同人與人的 kappa 相比較,用 ECE 和 Brier 分數衡量校準,並檢查位置偏差。

要判斷能否信任一個 LLM 評審,先讓至少兩個人在看不到評審答案的情況下給一批條目加標籤,再把評審與這些人的一致性,同這些人彼此之間的一致性作比較。如果評審與人的 Cohen kappa 接近人與人之間的 kappa,它的表現就大致相當於多了一名標註者;如果遠低於這個值,就不行。

LLM 評審(LLM-as-a-judge)是一個被提示去給輸出打分的語言模型,通常依據一套評分細則。Cohen kappa 衡量兩名評分者之間的一致性,並扣除了偶然情況下預期會出現的一致。評審是校準的,是指它的置信度與它實際答對的頻率相符:它以 80% 置信度給出的判決裡,大約 80% 應該是對的。

為什麼只和一個人比準確率不夠

通常第一步檢查的是準確率:你自己標註幾百個條目,統計評審有多少次與你一致。這個數字有兩個問題。它把一個人的標籤當作真值,連同這個人的錯誤一起;而且它沒有校正偶然一致,所以在大多數回覆都有用的資料集上,一個把所有回覆都判為"有用"的評審也能拿到高分。

Kappa 解決第二個問題。第二名人工標註者解決第一個問題,因為兩個認真的人之間的分歧,反映了這項任務本身允許達到的一致程度,而對評審的要求不能超過這個程度。

把評審與人與人之間的一致性相比較

報告三類配對:人與人、評審與人,以及在比較多個評審時的評審與評審。如果兩個人之間的一致性是 κ = 0.62,那麼與他們每個人都達到 0.60 的評審,表現就像第三名標註者,要求它達到 0.9 就是要求超出任務所能允許的程度。一個只有 0.35 的評審,無論原始準確率看起來多好,都談不上與人一致。

Zheng 等人 (2023) 在 MT-Bench 上做了同樣的比較,發現 GPT-4 與人類偏好的一致性和人與人之間的一致性相當。

如果人多於兩個,或者有些條目缺了部分標籤,除了兩兩之間的 kappa,還要報告所有評分者之間的 Fleiss kappa 或 Krippendorff alpha。如何選擇見標註者間一致性詳解

讓人工標註保持盲評

如果標註者能看到評審的答案,就會被它錨定,你測到的一致性裡有一部分其實是評審在和自己一致。收集人工標籤時,不要把評審的答案顯示在螢幕上。標註者審閱模型預標註時,同樣的效應也會抬高一致性。見識別未經審閱就接受的預標註

除了判決,還要檢查置信度

評審可能與人一致,卻仍然過度自信。如果用它的置信度來決定哪些條目轉給人工,過度自信就會讓本該複核的條目跳過稽核。

模型對自己給出的置信度,和它回答裡的其他內容一樣,只是生成出來的文本。取樣可以得到一個經驗性的置信度:在溫度大於零的設定下,對每個條目向評審提問 k 次,把出現最多的答案作為判決,把給出這個答案的樣本比例作為置信度。溫度為 0 時,k 個樣本完全相同,置信度永遠是 1.0。

期望校準誤差(ECE)把判決按置信度分組,比較每組的置信度和準確率。Brier 分數是置信度與結果之差的平方的平均值。可靠性圖把這些組畫在一條對角線旁邊,完全校準的評審會沿著這條線走。

測試成對評審的位置偏差

比較兩個回覆的評審,可能不論內容如何,都偏向排在前面的那個,或排在後面的那個。Zheng 等人記錄了 LLM 評審中的這種位置偏差。把每一對都跑兩次,交換順序。順序一換判決就翻轉,說明判決是由位置決定的;保持一致的配對所佔比例,應當和一致性一起寫進報告。見成對模型比較

有序量表

在 1–5 分的評分中,人給 5 分而評審給 4 分,幾乎就是一致的。普通 kappa 卻把它和 1 對 5 算成一樣的分歧。請使用加權 kappa,或採用有序或區間度量的 Krippendorff alpha,並同時報告平均絕對誤差。見評分量表

需要標註多少條目

用 50 個條目算出的 kappa,置信區間很寬,寬到兩個評審看起來不同,而差別其實只是噪聲。報告估計值時要附上區間,並在開始前確定人工樣本的規模;方法見標註研究的統計功效。按評審給出的標籤分層抽樣,可以讓稀有類別留在樣本里。

在 Potato 中怎麼做

Potato 的評審校準會對每個評審在每個條目上執行 k 次,並把它的標籤存放在單獨的儲存中,標註者永遠看不到。然後它抽取一個隨機或分層樣本供人工盲標,最後生成報告。

yaml
annotation_schemes:
  - annotation_type: radio
    name: helpfulness
    description: "Is this response helpful?"
    labels: [helpful, unhelpful]
 
judge_calibration:
  enabled: true
  prompt: |
    You are an impartial expert annotator. Classify the response as exactly
    one of: helpful, unhelpful.
  models:
    - endpoint_type: ollama
      model: llama3.1:8b
      base_url: http://localhost:11434
      temperature: 0.7
  k_samples: 5
  sampling:
    strategy: stratified
    sample_size: 200
    seed: 42
  human:
    num_raters: 2
    gold: majority
  schemas: [helpfulness]

報告給出每個模型相對人工金標準標籤的準確率、精確率、召回率和 F1,以及按人–模型、模型–模型和人–人配對拆分的 Cohen κ。它還包括所有評分者之間的 Fleiss κ 和 Krippendorff α、帶可靠性分箱的 ECE 和 Brier 分數,以及每個模型的混淆矩陣。對於 Likert 方案,還會加上平均絕對誤差和有序 α。從 2.9 版起,評審的評估卡還會顯示交換位置後的一致性,生成的標籤在人工階段結束前就可以在 /judge_calibration/results 檢視。

LLM 作為評審者的校準列出了全部選項。評審對齊介紹如何針對已有的金標準集調整單個評審的評分細則。

其他工具

LangSmith、Langfuse 和 Galileo 都能讓評審與人工修正對齊。Langfuse 計算人工分數與評審分數之間的 Cohen κ,每次比較兩個序列。Label Studio 的付費方案會顯示標註者與 LLM 在哪些地方一致。見 AI 智慧體評估工具對比

常見問題

LLM 評審與人之間的 kappa 多少算好?

沒有固定閾值。請把評審與人的 kappa,與同一批條目上兩個人之間的 kappa 相比較。接近人與人數值的評審,與人的一致程度大致相當於再多一名標註者。κ 和 α 常用的粗略標準(0.8 及以上可以信賴,0.67 到 0.8 可用於初步結論)描述的是整個任務,難度大的任務會限制任何評審所能達到的上限。

標註者應該看到 LLM 評審的答案嗎?

在衡量一致性期間不應該。看到評審判決的標註者往往會被它錨定,從而誇大評審表面上的一致性。如果一定要顯示判決,也要等校準樣本標註完再顯示。

怎樣檢查 LLM 評審的位置偏差?

每一對都呈現兩次,兩種順序各一次,統計判決隨順序改變了多少次。把保持一致的配對比例和一致性一起報告,判決發生翻轉的配對要麼丟棄,要麼重跑。

LLM 評審的期望校準誤差是什麼?

ECE 衡量評審的置信度與準確率之間的差距。判決按置信度分組,ECE 是各組置信度與該組中與人工標籤一致的判決比例之差,按組的大小加權後的平均值。校準良好的評審,ECE 接近零。

延伸閱讀