Skip to content

收集 RLHF 與偏好資料

如何為 RLHF 和模型對齊收集人類偏好資料,包括成對比較、評分量表打分與理由說明,並藉助 Potato 完成。

基於人類反饋的強化學習(RLHF)訓練模型以契合人類偏好。其核心資料是人類對模型輸出的比較判斷,最常見的形式是"這兩條回覆中哪一條更好?"。 把這類資料收集好本身就是一個標註問題,而 Potato 正是為此而生。

相關背景參見基於人類反饋的強化學習

標準做法:成對偏好

展示一個提示詞和兩條候選回覆,讓標註者選出更好的一條。這些判斷用於訓練一個對輸出打分的獎勵模型,再由它來引導策略模型。

yaml
annotation_schemes:
  - annotation_type: pairwise
    name: preference
    description: "Which response better follows the instruction and is more helpful and harmless?"
    mode: binary
    allow_tie: true
  - annotation_type: text
    name: rationale
    description: "One sentence on why you chose it."
    label_requirement:
      required: false

收集一句簡短的理由很有價值:它讓你能審查偏好資料,找出標註者優化了錯誤目標(長度、排版)而非品質的情形。

成對比較的機制參見成對比較與最優—最劣量表,模型間正面對決的評估參見模型成對比較

多維度偏好

單一的"更好"判斷會掩蓋各種取捨。若要採集為什麼某條輸出勝出的訊號,可用評分量表對多個標準分別打分:

yaml
annotation_schemes:
  - annotation_type: rubric_eval
    name: quality
    description: "Rate the response on each dimension."
    scale_points: 5
    criteria:
      - {name: Helpfulness, description: "Does it actually answer the request?"}
      - {name: Harmlessness, description: "Is it safe and appropriate?"}
      - {name: Honesty, description: "Is it accurate and non-misleading?"}

參見基於評分量表的 LLM 評估

偏好資料特有的品質陷阱

  • 長度與風格偏差。 標註者往往不論正確與否都偏好更長或更自信的回答。在標註指南中點明這一點,並加以留意。
  • 位置偏差。 隨機決定哪條回覆顯示為"A"。
  • 標準漂移。 定期重新分享錨定示例,以免長期任務中標準發生漂移。
  • 一致性。 偏好是主觀的,應收集重疊標註並跟蹤一致性

延伸閱讀