Skip to content

如何評估 AI 智慧體

用人工標註評估 AI 智慧體與 LLM 的概覽,涵蓋軌跡級、步驟級、跨度級與對比級評估,以及各自適配的 Potato 工具。

評估一個 AI 智慧體,不只是判斷它的最終答案,更要評估它走過的路徑,包括沿途的推理、工具呼叫和動作。在這件事上,人工標註仍是黃金標準,因為許多智慧體的失敗(看似合理實則錯誤的某一步、一次不安全的操作)只有人才能可靠地發現。 Potato 是一款用於對 LLM 智慧體軌跡進行人工標註的開源工具,為每個評估層級都提供了專門設計的檢視。

這裡的 AI 智慧體指的是由 LLM 驅動、通過多步動作(呼叫工具、瀏覽網頁或編寫程式碼)來完成任務的系統。參見智慧體評估概覽智慧體標註參考。

AI 智慧體評估有哪些層級?

根據你要回答的問題選擇相應層級:

  • 軌跡級:評判整個執行過程。是否成功?是否高效且安全?參見標註智慧體軌跡
  • 步驟級:評判每一個動作。這次工具呼叫是否正確?這一步是否必要?這正是過程獎勵模型所依賴的資料。
  • 跨度級:在輸出內部標出具體問題,例如某個幻覺式的論斷或一條不安全的指令。參見檢測幻覺
  • 對比級:將兩個智慧體或兩次執行直接對比評判。參見成對模型對比
  • 團隊級:對於多智慧體系統,把失敗歸因到負有責任的智慧體、步驟和交接。參見如何評估多智慧體系統

Potato 支援哪些智慧體軌跡格式?

Potato 可讀取 15 種格式的智慧體軌跡,包括 OpenAI 和 Anthropic 的工具呼叫、ReAct、LangChain、LangFuse、WebArena、SWE-bench、MCP 與 OpenTelemetry,並以針對不同類型智慧體調校過的檢視進行渲染:

我該選擇哪種智慧體評估方法?

你的問題方法
"智慧體完成任務了嗎?"軌跡成功標籤
"它究竟在哪裡出了錯?"步驟級錯誤分類體系
"哪個版本更好?"成對對比
"它在多個維度上表現如何?"評分量表評估
"基於檢索上下文給出的答案是否忠實?"RAG 評估
"團隊中的哪個智慧體導致了失敗?"多智慧體歸因
"computer-use 智慧體點對地方了嗎?"GUI 軌跡審查

延伸閱讀