過程獎勵模型與步驟級標註
如何通過把智慧體的步驟標註為正確或錯誤來收集過程獎勵(PRM)資料,包括首錯模式與逐步模式,使用 Potato 實現。
過程獎勵模型(PRM)評估智慧體所採取的推理步驟,而不僅僅是它的最終答案。訓練一個 PRM 需要步驟級標註:對於一條軌跡中的每一步,它是否正確? 正是這類資料,才能讓模型學會好好推理,而不是靠運氣碰到正確答案。
PRM 與結果獎勵模型(ORM)形成對照,後者只評估最終結果。在步驟級別進行標註,能夠捕捉到模型通過有缺陷的推理卻得到正確答案的情況。功能參考請見過程獎勵標註。
兩種標註模式
Potato 的 process_reward 類型支援兩種標準方案:
- 首錯模式:標註者標記第一個出錯的步驟;其後的每一步都會被自動視為受影響。速度快,也契合推理失敗逐級蔓延的方式。
- 逐步模式:標註者獨立地判斷每一步是正確還是錯誤。更細粒度,也更費力。
yaml
annotation_schemes:
- annotation_type: process_reward
name: step_rewards
description: "Mark the first incorrect step. Steps after it are flagged automatically."
steps_key: structured_turns
mode: first_error
mode: first_error這些顏色讓蔓延過程一目瞭然:綠色步驟是好的,紅色步驟是第一個錯誤,橙色則標出如今變得可疑的下游步驟。
何時使用哪種模式
- 首錯模式適用於數學、程式設計以及鏈式推理等場景,在這些場景中一個錯誤會使其餘步驟全部失效。更省成本,通常也足夠用。
- 逐步模式適用於步驟彼此獨立的情形,或當你需要為每一步獲得密集的獎勵訊號時。
品質方面的考量
- 精確定義什麼是"正確步驟":是既正確又有用,還是僅僅不出錯?對於一個冗餘但無害的步驟,需要有明確的判定規則。
- 推理在邊緣情形下是主觀的,應在一個樣本上收集重疊標註並檢查一致性。
- 與一個軌跡級的結果標籤配合使用,以便研究好的結果在哪些地方掩蓋了糟糕的推理。參見標註智慧體軌跡。