如何評估 AI 智慧體
用人工標註評估 AI 智慧體與 LLM 的概覽,涵蓋軌跡級、步驟級、跨度級與對比級評估,以及各自適配的 Potato 工具。
評估一個 AI 智慧體,不只是判斷它的最終答案,更要評估它走過的路徑,包括沿途的推理、工具呼叫和動作。在這件事上,人工標註仍是黃金標準,因為許多智慧體的失敗(看似合理實則錯誤的某一步、一次不安全的操作)只有人才能可靠地發現。 Potato 是一款用於對 LLM 智慧體軌跡進行人工標註的開源工具,為每個評估層級都提供了專門設計的檢視。
這裡的 AI 智慧體指的是由 LLM 驅動、通過多步動作(呼叫工具、瀏覽網頁或編寫程式碼)來完成任務的系統。參見智慧體評估概覽與智慧體標註參考。
AI 智慧體評估有哪些層級?
根據你要回答的問題選擇相應層級:
- 軌跡級:評判整個執行過程。是否成功?是否高效且安全?參見標註智慧體軌跡。
- 步驟級:評判每一個動作。這次工具呼叫是否正確?這一步是否必要?這正是過程獎勵模型所依賴的資料。
- 跨度級:在輸出內部標出具體問題,例如某個幻覺式的論斷或一條不安全的指令。參見檢測幻覺。
- 對比級:將兩個智慧體或兩次執行直接對比評判。參見成對模型對比。
- 團隊級:對於多智慧體系統,把失敗歸因到負有責任的智慧體、步驟和交接。參見如何評估多智慧體系統。
Potato 支援哪些智慧體軌跡格式?
Potato 可讀取 15 種格式的智慧體軌跡,包括 OpenAI 和 Anthropic 的工具呼叫、ReAct、LangChain、LangFuse、WebArena、SWE-bench、MCP 與 OpenTelemetry,並以針對不同類型智慧體調校過的檢視進行渲染:
- 智慧體軌跡檢視,用於推理/工具呼叫軌跡。
- 網頁智慧體檢視,帶截圖和動作疊加層,參見網頁智慧體評估。
- 編碼軌跡檢視,帶 diff 和終端輸出,參見編碼智慧體評估。
- 即時智慧體檢視,用於即時觀察並引導智慧體,參見即時智慧體評估。
- 多模態智慧體檢視,用於 computer-use、語音和影片智慧體,參見評估 computer-use 與多模態智慧體。
我該選擇哪種智慧體評估方法?
| 你的問題 | 方法 |
|---|---|
| "智慧體完成任務了嗎?" | 軌跡成功標籤 |
| "它究竟在哪裡出了錯?" | 步驟級錯誤分類體系 |
| "哪個版本更好?" | 成對對比 |
| "它在多個維度上表現如何?" | 評分量表評估 |
| "基於檢索上下文給出的答案是否忠實?" | RAG 評估 |
| "團隊中的哪個智慧體導致了失敗?" | 多智慧體歸因 |
| "computer-use 智慧體點對地方了嗎?" | GUI 軌跡審查 |