Skip to content

標註智慧體軌跡

如何逐步標註 AI 智慧體軌跡、錯誤分類法、嚴重程度評分以及軌跡級成功判定,使用 Potato 的軌跡評估功能。

軌跡是智慧體所執行的完整步驟序列,包括它的思考、工具呼叫和觀察結果。標註一條軌跡意味著把整次執行作為整體來判斷,並標出各個步驟在哪裡出了錯,為每個錯誤標註類別和嚴重程度。 Potato 用自定義評分量表逐步標註智慧體軌跡,免費且可自託管,生成獎勵模型和定向除錯背後的資料。

功能參考請見智慧體標註

標註軌跡時你要收集什麼?

  • 整體結果:成功、部分成功還是失敗。
  • 逐步判斷:對每一步,它是正確、不必要還是錯誤?
  • 錯誤類別:某一步為何出錯(用錯工具、參數有誤、幻覺、迴圈、不安全操作……)。
  • 嚴重程度:每個錯誤有多嚴重,通常會加權計入分數。

如何在 Potato 中設定軌跡評估?

Potato 的 trajectory_eval 類型把每一步渲染成一張卡片,併為每一步附上帶嚴重程度權重的錯誤分類法:

yaml
annotation_schemes:
  - annotation_type: trajectory_eval
    name: step_evaluation
    description: "Evaluate each step for correctness and mark any errors."
    steps_key: steps
    error_types:
      - {name: reasoning,  subtypes: [logical_error, factual_error, planning_error]}
      - {name: execution,  subtypes: [wrong_tool, wrong_args, api_error]}
      - {name: safety,     subtypes: [harmful_action, data_leak, scope_violation]}
    severities:
      - {name: minor,    weight: -1}
      - {name: major,    weight: -5}
      - {name: critical, weight: -10}
    show_score: true

嚴重程度權重會彙總成一個軌跡分數,於是你可以對執行排序,並跨模型版本跟蹤迴歸。

如何設計智慧體錯誤分類法?

分類法是這項任務的核心。要讓它精簡、窮盡且互斥。一個實用的起步集合:

  • 推理錯誤:結論錯誤、忽視證據、計劃不當。
  • 執行錯誤:用錯工具、呼叫格式錯誤、結果處理不當。
  • 安全錯誤:不安全操作、越界行為、資料洩露。

加上一個自由文本的"其他",這樣標註者就不會被迫把新出現的失敗硬塞進現有類別;隨後把反覆出現的"其他"備註提升為命名類別。

品質考量

  • 步驟正確性的一致性通常較高;對錯誤類別的一致性則較低。兩者都要測量,參見標註者間一致性
  • 長軌跡容易令人疲勞;限制長度或分頁處理。
  • 對訓練而言,"第一個出錯的步驟"往往最為關鍵,參見過程獎勵模型

延伸閱讀