Skip to content

成對比較與最佳-最差量表

何時用比較判斷代替評分,成對比較與最佳-最差量表(MaxDiff),以及如何在 Potato 中設定它們。

人不擅長給出穩定的絕對分數,卻擅長比較。比較式標註正是利用了這一點:與其問"給這條打 1–5 分",不如問"A 和 B 哪個更好?"。 兩種主要形式是成對比較和最佳-最差量表。它們是現代 AI 偏好資料的支柱。

背景知識參見 Pairwise comparisonMaxDiff

成對比較

展示兩個條目,問哪個勝出。它簡單、一致性高,也是為基於人類反饋的強化學習收集人類偏好資料所用的格式。

yaml
annotation_schemes:
  - annotation_type: pairwise
    name: preference
    description: "Which response better answers the question?"
    mode: binary
    allow_tie: true
    sequential_key_binding: true

允許平局可以避免標註者在本無差別處硬造出差異。若想捕捉好多少,可把 mode 切換為量表(例如"A 明顯更好 … B 明顯更好")。成對偏好展示是一個可用的示例。

許多成對判斷可以用某種模型彙總成單一排名,例如 Elo 評分系統Bradley–Terry 模型

最佳-最差量表(MaxDiff)

展示一小組條目(通常四個),讓標註者選出最佳最差。每次判斷都比單次成對投票包含更多資訊,因為它一次性固定了這組的兩端。

yaml
annotation_schemes:
  - annotation_type: bws
    name: fluency
    description: "Pick the most and least fluent translation."
    tuple_size: 4
    best_description: "Most fluent"
    worst_description: "Least fluent"

最佳-最差量表能從簡單的選擇中產生可靠的、近似等距的分數,被廣泛用於彙集眾多標註者來構建經過校準的排名。

何時應優先選擇比較而非評分

  • 你的構念難以絕對錨定(幽默、有用性、審美品質)。
  • 你需要高一致性,而你的 Likert 量表噪聲很大。
  • 你正在構建用於訓練或對齊模型的偏好資料。

代價在於你得到的是相對資訊;要還原絕對分數,可能需要藉助某種模型(Elo、Bradley–Terry)。

延伸閱讀