模型兩兩對比
如何讓人工標註者對兩個模型或兩條回覆進行正面對決式比較,包括多維度比較與偏差控制,使用 Potato。
要判斷兩個模型孰優孰劣,就把一條提示和兩條回覆一起展示給標註者,讓他們選出哪一條更好。把大量提示上的正面對決判斷彙總起來,得到的模型排名比絕對打分更可靠。 這正是基於人工投票的公開模型排行榜背後的方法。
這是把兩兩對比應用到模型輸出上;許多次比較可以通過 Elo 或 Bradley–Terry 模型轉化為單一的排名。
基本的正面對決
yaml
annotation_schemes:
- annotation_type: pairwise
name: which_better
description: "Which response is better overall?"
mode: binary
allow_tie: true多維度比較
單一的"更好"會掩蓋取捨:模型 A 更準確,但模型 B 更清晰。可以同時從多個維度進行比較:
yaml
annotation_schemes:
- annotation_type: pairwise
name: comparison
description: "Compare the two responses on each dimension."
mode: multi_dimension要求填寫理由能讓資料可供審查,並暴露出標註者獎勵了錯誤物件的情形。
控制偏差
正面對決資料的品質取決於它的偏差控制:
- 位置偏差:隨機決定哪個模型顯示為"A";否則標註者會偏向某一側。
- 長度/風格偏差:標註者往往偏好更長或語氣更自信的文本,而不論其品質如何。要在指南中點明這一點。
- 冗長 ≠ 品質:不妨記錄文本長度,以便檢查它是否在左右勝負。
- 一致性:收集重疊標註並跟蹤標註者間一致性。
兩兩對比 vs. 評分量表
當你需要排名並希望獲得高一致性時,使用兩兩對比。當你需要對每個模型給出絕對的、按維度劃分的畫像時,使用評分量表。許多評估會同時採用兩者。