Skip to content

模型兩兩對比

如何讓人工標註者對兩個模型或兩條回覆進行正面對決式比較,包括多維度比較與偏差控制,使用 Potato。

要判斷兩個模型孰優孰劣,就把一條提示和兩條回覆一起展示給標註者,讓他們選出哪一條更好。把大量提示上的正面對決判斷彙總起來,得到的模型排名比絕對打分更可靠。 這正是基於人工投票的公開模型排行榜背後的方法。

這是把兩兩對比應用到模型輸出上;許多次比較可以通過 EloBradley–Terry 模型轉化為單一的排名。

基本的正面對決

yaml
annotation_schemes:
  - annotation_type: pairwise
    name: which_better
    description: "Which response is better overall?"
    mode: binary
    allow_tie: true

多維度比較

單一的"更好"會掩蓋取捨:模型 A 更準確,但模型 B 更清晰。可以同時從多個維度進行比較:

yaml
annotation_schemes:
  - annotation_type: pairwise
    name: comparison
    description: "Compare the two responses on each dimension."
    mode: multi_dimension

要求填寫理由能讓資料可供審查,並暴露出標註者獎勵了錯誤物件的情形。

控制偏差

正面對決資料的品質取決於它的偏差控制:

  • 位置偏差:隨機決定哪個模型顯示為"A";否則標註者會偏向某一側。
  • 長度/風格偏差:標註者往往偏好更長或語氣更自信的文本,而不論其品質如何。要在指南中點明這一點。
  • 冗長 ≠ 品質:不妨記錄文本長度,以便檢查它是否在左右勝負。
  • 一致性:收集重疊標註並跟蹤標註者間一致性

兩兩對比 vs. 評分量表

當你需要排名並希望獲得高一致性時,使用兩兩對比。當你需要對每個模型給出絕對的、按維度劃分的畫像時,使用評分量表。許多評估會同時採用兩者。

延伸閱讀