Skip to content

過程獎勵模型與步驟級標註

如何通過把智慧體的步驟標註為正確或錯誤來收集過程獎勵(PRM)資料,包括首錯模式與逐步模式,使用 Potato 實現。

過程獎勵模型(PRM)評估智慧體所採取的推理步驟,而不僅僅是它的最終答案。訓練一個 PRM 需要步驟級標註:對於一條軌跡中的每一步,它是否正確? 正是這類資料,才能讓模型學會好好推理,而不是靠運氣碰到正確答案。

PRM 與結果獎勵模型(ORM)形成對照,後者只評估最終結果。在步驟級別進行標註,能夠捕捉到模型通過有缺陷的推理卻得到正確答案的情況。功能參考請見過程獎勵標註

兩種標註模式

Potato 的 process_reward 類型支援兩種標準方案:

  • 首錯模式:標註者標記第一個出錯的步驟;其後的每一步都會被自動視為受影響。速度快,也契合推理失敗逐級蔓延的方式。
  • 逐步模式:標註者獨立地判斷每一步是正確還是錯誤。更細粒度,也更費力。
yaml
annotation_schemes:
  - annotation_type: process_reward
    name: step_rewards
    description: "Mark the first incorrect step. Steps after it are flagged automatically."
    steps_key: structured_turns
    mode: first_error
    mode: first_error

這些顏色讓蔓延過程一目瞭然:綠色步驟是好的,紅色步驟是第一個錯誤,橙色則標出如今變得可疑的下游步驟。

何時使用哪種模式

  • 首錯模式適用於數學、程式設計以及鏈式推理等場景,在這些場景中一個錯誤會使其餘步驟全部失效。更省成本,通常也足夠用。
  • 逐步模式適用於步驟彼此獨立的情形,或當你需要為每一步獲得密集的獎勵訊號時。

品質方面的考量

  • 精確定義什麼是"正確步驟":是既正確有用,還是僅僅不出錯?對於一個冗餘但無害的步驟,需要有明確的判定規則。
  • 推理在邊緣情形下是主觀的,應在一個樣本上收集重疊標註並檢查一致性
  • 與一個軌跡級的結果標籤配合使用,以便研究好的結果在哪些地方掩蓋了糟糕的推理。參見標註智慧體軌跡

延伸閱讀