標註智慧體軌跡
如何逐步標註 AI 智慧體軌跡、錯誤分類法、嚴重程度評分以及軌跡級成功判定,使用 Potato 的軌跡評估功能。
軌跡是智慧體所執行的完整步驟序列,包括它的思考、工具呼叫和觀察結果。標註一條軌跡意味著把整次執行作為整體來判斷,並標出各個步驟在哪裡出了錯,為每個錯誤標註類別和嚴重程度。 Potato 用自定義評分量表逐步標註智慧體軌跡,免費且可自託管,生成獎勵模型和定向除錯背後的資料。
功能參考請見智慧體標註。
標註軌跡時你要收集什麼?
- 整體結果:成功、部分成功還是失敗。
- 逐步判斷:對每一步,它是正確、不必要還是錯誤?
- 錯誤類別:某一步為何出錯(用錯工具、參數有誤、幻覺、迴圈、不安全操作……)。
- 嚴重程度:每個錯誤有多嚴重,通常會加權計入分數。
如何在 Potato 中設定軌跡評估?
Potato 的 trajectory_eval 類型把每一步渲染成一張卡片,併為每一步附上帶嚴重程度權重的錯誤分類法:
yaml
annotation_schemes:
- annotation_type: trajectory_eval
name: step_evaluation
description: "Evaluate each step for correctness and mark any errors."
steps_key: steps
error_types:
- {name: reasoning, subtypes: [logical_error, factual_error, planning_error]}
- {name: execution, subtypes: [wrong_tool, wrong_args, api_error]}
- {name: safety, subtypes: [harmful_action, data_leak, scope_violation]}
severities:
- {name: minor, weight: -1}
- {name: major, weight: -5}
- {name: critical, weight: -10}
show_score: true嚴重程度權重會彙總成一個軌跡分數,於是你可以對執行排序,並跨模型版本跟蹤迴歸。
如何設計智慧體錯誤分類法?
分類法是這項任務的核心。要讓它精簡、窮盡且互斥。一個實用的起步集合:
- 推理錯誤:結論錯誤、忽視證據、計劃不當。
- 執行錯誤:用錯工具、呼叫格式錯誤、結果處理不當。
- 安全錯誤:不安全操作、越界行為、資料洩露。
加上一個自由文本的"其他",這樣標註者就不會被迫把新出現的失敗硬塞進現有類別;隨後把反覆出現的"其他"備註提升為命名類別。