AI 智慧體評估工具對比:LangSmith、Langfuse、Phoenix 與 Potato
從智慧體軌跡的人工稽核角度對比 LangSmith、Langfuse、Arize Phoenix、Braintrust、Opik、W&B Weave 與 Potato:標註佇列、逐步標籤、一致性和自行部署。
評估 AI 智慧體的工具分為兩類。可觀測性平臺,包括 LangSmith、Langfuse、Arize Phoenix、Braintrust 和 Opik,在生產環境中追蹤智慧體,讓稽核者給執行和 span 打分。Potato 這樣的標註工具則從人工研究出發:每條軌跡有多名稽核者,每一步都有標籤,並衡量稽核者之間的一致程度。 兩者可以配合使用:繼續在原來的地方做追蹤,匯出需要評判的執行,再到標註工具裡開展研究。
智慧體軌跡(trace)記錄了智慧體走過的每一步:它的推理、呼叫的工具以及工具返回的結果。人工評估可以給整次執行打分,給每一步加標籤,或者把兩次執行並排比較。LLM 評審(LLM-as-a-judge)會自動給軌跡打分,但需要人工標籤來檢驗它。見如何評估 AI 智慧體。
本頁討論智慧體和 LLM 的評估。所有資料類型放在一頁裡的對比見 AI 標註工具對比。
哪些智慧體評估工具值得比較?
| 工具 | 定位 | 人工稽核 |
|---|---|---|
| LangSmith | 追蹤和評估 LangChain 與 LangGraph 應用 | 帶評分細則反饋的標註佇列、每次執行可有多名稽核者、成對比較佇列 |
| Langfuse | 開源的追蹤、提示詞管理與評估 | 標註佇列,以及用於分類或數值分數的分數配置 |
| Arize Phoenix | 追蹤與評估 | 標註配置,支援來自人、LLM 或程式碼的分類、連續和自由文本反饋 |
| Braintrust | 評估與日誌 | 人工稽核分數:分類、連續和自由文本 |
| Comet Opik | 開源的追蹤與評估 | 可通過連結分享給領域專家的標註佇列 |
| W&B Weave | 追蹤與評估 | 在介面或 API 中定義的人工標註評分器 |
| Label Studio | 通用標註 | 匯入 LangGraph、CrewAI 和 AutoGen 軌跡,做逐步稽核 |
| Potato | 人工標註研究 | 帶錯誤分類體系的逐步標籤、多智慧體圖、成對比較、稽核者間一致性 |
我們的能力對照表中各工具的自行部署與價格:
| 自行部署 | 價格 | |
|---|---|---|
| LangSmith | 僅限 Enterprise 方案 | 每席位每月 39 美元 |
| Langfuse | 免費(MIT) | 自行部署免費 |
| Comet Opik | 免費(Apache-2.0) | 自行部署免費 |
| Galileo | Enterprise 合同 | 每月 100 美元 |
| Potato | 免費(GPL-3.0) | 免費 |
各平臺如何處理人工分數
LangSmith 的標註佇列支援評分細則反饋鍵、可配置的每次執行稽核人數、成對比較佇列,以及彼此看不到對方反饋的稽核者。
Langfuse 通過分數配置定義分數,並通過標註佇列把軌跡、觀測和會話分派給稽核者。在其社群論壇上,有使用者在 2025 年 11 月反映,兩個人仍然無法在同一個佇列裡獨立標註同一條軌跡;那裡討論的變通辦法是給每位標註者單獨建一個分數配置(討論 #4348)。Langfuse 可以計算人工分數與 LLM 評審分數之間的 Cohen κ,每次比較兩個序列。
Arize Phoenix 讓來自人、LLM 和程式碼的標註共用同一種結構,並用標註配置保證各次稽核的標籤一致。標註過的 span 可以匯出為資料集,用於實驗,或用來構建與人工判斷對齊的評估器。
Braintrust 給日誌和實驗附加人工稽核分數。它的文件說明,對部分稽核者隱藏某個分數只是為了讓稽核介面更清爽,並不是訪問控制,因為任何稽核者都可以顯示全部分數。
Comet Opik 把軌跡和對話執行緒放進標註佇列,並能通過連結分享給領域專家,稽核介面是為非技術背景的稽核者設計的。
W&B Weave 通過人工標註評分器記錄人工反饋,評分器在介面中或通過 API 建立。
我們在 2026 年 8 月和 9 月核查時,沒有在 LangSmith、Langfuse、Phoenix、Braintrust 或 Opik 的標註文件中找到人工稽核者之間一致性的統計。它們都把人工判斷作為分數來收集。Labelbox 和 Scale AI 以託管服務的形式出售智慧體評估資料,這是另一種採購:他們連稽核人員也一併提供。
Potato 的不同之處
- 支援多種框架的軌跡。 轉換器可以讀取 15 種格式:ReAct、OpenAI、Anthropic、LangChain(涵蓋 LangSmith 的匯出)、Langfuse、來自 CrewAI、AutoGen 和 LangGraph 的多智慧體日誌、SWE-bench、SWE-Agent、Claude Code、Aider、WebArena、Mind2Web 及其他瀏覽器錄製、MCP、OpenTelemetry 和 ATIF。
- 每一步都有標籤。
trajectory_eval方案記錄每一步是否正確、來自層級化分類體系的錯誤類型、嚴重程度和累計分數。這些標籤同時就是過程獎勵模型的訓練資料。 - 多智慧體結構。 稽核者可以編輯互動圖、標出關鍵路徑、把失敗歸因到某個智慧體和某一步,並稽核交接。Langfuse 的 Agent Graphs 檢視把多智慧體執行顯示為用於除錯的圖,但稽核者不能在上面標註。見如何評估多智慧體系統。
- 稽核者之間的一致性。 每條軌跡可以分給多名互相看不到對方標籤的稽核者,並報告標註者間一致性。評審校準把 LLM 評審與盲標的人工標籤作比較。見如何衡量 LLM 評審者與人類標註者之間的一致性。
- 程式設計智慧體和計算機操作智慧體。 帶語法高亮的統一 diff、終端輸出,以及錨定到程式碼行的稽核評論。計算機操作的執行會顯示帶點選位置的截圖。見程式設計智慧體評估和評估計算機操作智慧體。
把軌跡匯入 Potato
從可觀測性工具中匯出需要稽核的執行,然後轉換:
python -m potato.trace_converter \
--input langfuse_traces.json \
--output data/traces.jsonl \
--input-format langfuseLangSmith 的執行匯出使用 --input-format langchain。如果某個框架不在列表裡,--auto-detect 會根據欄位名選擇轉換器。
Potato 中的逐步稽核任務
annotation_schemes:
- annotation_type: trajectory_eval
name: step_evaluation
description: "Evaluate each step for correctness and mark any errors."
steps_key: steps
error_types:
- {name: reasoning, subtypes: [logical_error, factual_error, planning_error]}
- {name: execution, subtypes: [wrong_tool, wrong_args, api_error]}
severities:
- {name: minor, weight: -1}
- {name: major, weight: -5}
show_score: true如何設計錯誤分類體系,見標註智慧體軌跡。
Potato 在智慧體上不做的事
- 它不是生產監控服務。 它有支援 OpenTelemetry 匯出的追蹤 SDK,但沒有託管雲,也沒有為生產流量的延遲和成本設計的看板。它只能自行部署。
- 不提供稽核人員。 請自帶稽核者,或在 Prolific 上招募。
常見問題
在人工稽核方面,LangSmith 和 Langfuse 有什麼區別?
兩者都通過標註佇列給軌跡和 span 附加人工分數。LangSmith 是專有軟體,在 Enterprise 方案下可以自行部署,支援每次執行多名稽核者和成對比較佇列。Langfuse 採用 MIT 許可證,可以免費自行部署;在其論壇上,有使用者反映兩個人還不能在同一個佇列裡獨立給同一條軌跡打分。兩者的文件都沒有提供人工稽核者之間一致性的統計。
智慧體評估有沒有 LangSmith 的開源替代品?
在追蹤和打分方面,Langfuse(MIT)和 Comet Opik(Apache-2.0)都是開源的,可以免費自行部署。對於人工評估研究,即每條軌跡多名稽核者、逐步標籤和一致性,Potato 是開源且免費的。Potato 能讀取 LangSmith 和 Langfuse 的匯出,因此可以與兩者中的任何一個配合使用。
如何衡量人工稽核者在智慧體軌跡上的一致性?
每條軌跡至少分給兩名互相看不到對方標籤的稽核者,然後按問題分別計算:兩名稽核者用 Cohen κ,多於兩名用 Krippendorff α。逐步標籤需要先把步驟對應起來。係數的選擇見標註者間一致性詳解。
能在 Potato 中使用來自 LangSmith 或 Langfuse 的軌跡嗎?
能。python -m potato.trace_converter 用 --input-format langchain 轉換 LangSmith 的執行匯出,用 --input-format langfuse 轉換 Langfuse 的匯出。生產追蹤保持原樣,只把需要評判的軌跡匯入 Potato。