收集 RLHF 與偏好資料
如何為 RLHF 和模型對齊收集人類偏好資料,包括成對比較、評分量表打分與理由說明,並藉助 Potato 完成。
基於人類反饋的強化學習(RLHF)訓練模型以契合人類偏好。其核心資料是人類對模型輸出的比較判斷,最常見的形式是"這兩條回覆中哪一條更好?"。 把這類資料收集好本身就是一個標註問題,而 Potato 正是為此而生。
相關背景參見基於人類反饋的強化學習。
標準做法:成對偏好
展示一個提示詞和兩條候選回覆,讓標註者選出更好的一條。這些判斷用於訓練一個對輸出打分的獎勵模型,再由它來引導策略模型。
yaml
annotation_schemes:
- annotation_type: pairwise
name: preference
description: "Which response better follows the instruction and is more helpful and harmless?"
mode: binary
allow_tie: true
- annotation_type: text
name: rationale
description: "One sentence on why you chose it."
label_requirement:
required: false收集一句簡短的理由很有價值:它讓你能審查偏好資料,找出標註者優化了錯誤目標(長度、排版)而非品質的情形。
成對比較的機制參見成對比較與最優—最劣量表,模型間正面對決的評估參見模型成對比較。
多維度偏好
單一的"更好"判斷會掩蓋各種取捨。若要採集為什麼某條輸出勝出的訊號,可用評分量表對多個標準分別打分:
yaml
annotation_schemes:
- annotation_type: rubric_eval
name: quality
description: "Rate the response on each dimension."
scale_points: 5
criteria:
- {name: Helpfulness, description: "Does it actually answer the request?"}
- {name: Harmlessness, description: "Is it safe and appropriate?"}
- {name: Honesty, description: "Is it accurate and non-misleading?"}偏好資料特有的品質陷阱
- 長度與風格偏差。 標註者往往不論正確與否都偏好更長或更自信的回答。在標註指南中點明這一點,並加以留意。
- 位置偏差。 隨機決定哪條回覆顯示為"A"。
- 標準漂移。 定期重新分享錨定示例,以免長期任務中標準發生漂移。
- 一致性。 偏好是主觀的,應收集重疊標註並跟蹤一致性。