成對比較與最佳-最差量表
何時用比較判斷代替評分,成對比較與最佳-最差量表(MaxDiff),以及如何在 Potato 中設定它們。
人不擅長給出穩定的絕對分數,卻擅長比較。比較式標註正是利用了這一點:與其問"給這條打 1–5 分",不如問"A 和 B 哪個更好?"。 兩種主要形式是成對比較和最佳-最差量表。它們是現代 AI 偏好資料的支柱。
背景知識參見 Pairwise comparison 和 MaxDiff。
成對比較
展示兩個條目,問哪個勝出。它簡單、一致性高,也是為基於人類反饋的強化學習收集人類偏好資料所用的格式。
yaml
annotation_schemes:
- annotation_type: pairwise
name: preference
description: "Which response better answers the question?"
mode: binary
allow_tie: true
sequential_key_binding: true允許平局可以避免標註者在本無差別處硬造出差異。若想捕捉好多少,可把 mode 切換為量表(例如"A 明顯更好 … B 明顯更好")。成對偏好展示是一個可用的示例。
許多成對判斷可以用某種模型彙總成單一排名,例如 Elo 評分系統或 Bradley–Terry 模型。
最佳-最差量表(MaxDiff)
展示一小組條目(通常四個),讓標註者選出最佳和最差。每次判斷都比單次成對投票包含更多資訊,因為它一次性固定了這組的兩端。
yaml
annotation_schemes:
- annotation_type: bws
name: fluency
description: "Pick the most and least fluent translation."
tuple_size: 4
best_description: "Most fluent"
worst_description: "Least fluent"最佳-最差量表能從簡單的選擇中產生可靠的、近似等距的分數,被廣泛用於彙集眾多標註者來構建經過校準的排名。
何時應優先選擇比較而非評分
- 你的構念難以絕對錨定(幽默、有用性、審美品質)。
- 你需要高一致性,而你的 Likert 量表噪聲很大。
- 你正在構建用於訓練或對齊模型的偏好資料。
代價在於你得到的是相對資訊;要還原絕對分數,可能需要藉助某種模型(Elo、Bradley–Terry)。