Skip to content

AI 智慧體評估工具對比:LangSmith、Langfuse、Phoenix 與 Potato

從智慧體軌跡的人工稽核角度對比 LangSmith、Langfuse、Arize Phoenix、Braintrust、Opik、W&B Weave 與 Potato:標註佇列、逐步標籤、一致性和自行部署。

評估 AI 智慧體的工具分為兩類。可觀測性平臺,包括 LangSmith、Langfuse、Arize Phoenix、Braintrust 和 Opik,在生產環境中追蹤智慧體,讓稽核者給執行和 span 打分。Potato 這樣的標註工具則從人工研究出發:每條軌跡有多名稽核者,每一步都有標籤,並衡量稽核者之間的一致程度。 兩者可以配合使用:繼續在原來的地方做追蹤,匯出需要評判的執行,再到標註工具裡開展研究。

智慧體軌跡(trace)記錄了智慧體走過的每一步:它的推理、呼叫的工具以及工具返回的結果。人工評估可以給整次執行打分,給每一步加標籤,或者把兩次執行並排比較。LLM 評審(LLM-as-a-judge)會自動給軌跡打分,但需要人工標籤來檢驗它。見如何評估 AI 智慧體

本頁討論智慧體和 LLM 的評估。所有資料類型放在一頁裡的對比見 AI 標註工具對比

哪些智慧體評估工具值得比較?

工具定位人工稽核
LangSmith追蹤和評估 LangChain 與 LangGraph 應用帶評分細則反饋的標註佇列、每次執行可有多名稽核者、成對比較佇列
Langfuse開源的追蹤、提示詞管理與評估標註佇列,以及用於分類或數值分數的分數配置
Arize Phoenix追蹤與評估標註配置,支援來自人、LLM 或程式碼的分類、連續和自由文本反饋
Braintrust評估與日誌人工稽核分數:分類、連續和自由文本
Comet Opik開源的追蹤與評估可通過連結分享給領域專家的標註佇列
W&B Weave追蹤與評估在介面或 API 中定義的人工標註評分器
Label Studio通用標註匯入 LangGraph、CrewAI 和 AutoGen 軌跡,做逐步稽核
Potato人工標註研究帶錯誤分類體系的逐步標籤、多智慧體圖、成對比較、稽核者間一致性

我們的能力對照表中各工具的自行部署與價格:

自行部署價格
LangSmith僅限 Enterprise 方案每席位每月 39 美元
Langfuse免費(MIT)自行部署免費
Comet Opik免費(Apache-2.0)自行部署免費
GalileoEnterprise 合同每月 100 美元
Potato免費(GPL-3.0)免費

各平臺如何處理人工分數

LangSmith 的標註佇列支援評分細則反饋鍵、可配置的每次執行稽核人數、成對比較佇列,以及彼此看不到對方反饋的稽核者。

Langfuse 通過分數配置定義分數,並通過標註佇列把軌跡、觀測和會話分派給稽核者。在其社群論壇上,有使用者在 2025 年 11 月反映,兩個人仍然無法在同一個佇列裡獨立標註同一條軌跡;那裡討論的變通辦法是給每位標註者單獨建一個分數配置(討論 #4348)。Langfuse 可以計算人工分數與 LLM 評審分數之間的 Cohen κ,每次比較兩個序列。

Arize Phoenix 讓來自人、LLM 和程式碼的標註共用同一種結構,並用標註配置保證各次稽核的標籤一致。標註過的 span 可以匯出為資料集,用於實驗,或用來構建與人工判斷對齊的評估器。

Braintrust 給日誌和實驗附加人工稽核分數。它的文件說明,對部分稽核者隱藏某個分數只是為了讓稽核介面更清爽,並不是訪問控制,因為任何稽核者都可以顯示全部分數。

Comet Opik 把軌跡和對話執行緒放進標註佇列,並能通過連結分享給領域專家,稽核介面是為非技術背景的稽核者設計的。

W&B Weave 通過人工標註評分器記錄人工反饋,評分器在介面中或通過 API 建立。

我們在 2026 年 8 月和 9 月核查時,沒有在 LangSmith、Langfuse、Phoenix、Braintrust 或 Opik 的標註文件中找到人工稽核者之間一致性的統計。它們都把人工判斷作為分數來收集。Labelbox 和 Scale AI 以託管服務的形式出售智慧體評估資料,這是另一種採購:他們連稽核人員也一併提供。

Potato 的不同之處

  • 支援多種框架的軌跡。 轉換器可以讀取 15 種格式:ReAct、OpenAI、Anthropic、LangChain(涵蓋 LangSmith 的匯出)、Langfuse、來自 CrewAI、AutoGen 和 LangGraph 的多智慧體日誌、SWE-bench、SWE-Agent、Claude Code、Aider、WebArena、Mind2Web 及其他瀏覽器錄製、MCP、OpenTelemetry 和 ATIF。
  • 每一步都有標籤。 trajectory_eval 方案記錄每一步是否正確、來自層級化分類體系的錯誤類型、嚴重程度和累計分數。這些標籤同時就是過程獎勵模型的訓練資料。
  • 多智慧體結構。 稽核者可以編輯互動圖、標出關鍵路徑、把失敗歸因到某個智慧體和某一步,並稽核交接。Langfuse 的 Agent Graphs 檢視把多智慧體執行顯示為用於除錯的圖,但稽核者不能在上面標註。見如何評估多智慧體系統
  • 稽核者之間的一致性。 每條軌跡可以分給多名互相看不到對方標籤的稽核者,並報告標註者間一致性。評審校準把 LLM 評審與盲標的人工標籤作比較。見如何衡量 LLM 評審者與人類標註者之間的一致性
  • 程式設計智慧體和計算機操作智慧體。 帶語法高亮的統一 diff、終端輸出,以及錨定到程式碼行的稽核評論。計算機操作的執行會顯示帶點選位置的截圖。見程式設計智慧體評估評估計算機操作智慧體

把軌跡匯入 Potato

從可觀測性工具中匯出需要稽核的執行,然後轉換:

bash
python -m potato.trace_converter \
  --input langfuse_traces.json \
  --output data/traces.jsonl \
  --input-format langfuse

LangSmith 的執行匯出使用 --input-format langchain。如果某個框架不在列表裡,--auto-detect 會根據欄位名選擇轉換器。

Potato 中的逐步稽核任務

yaml
annotation_schemes:
  - annotation_type: trajectory_eval
    name: step_evaluation
    description: "Evaluate each step for correctness and mark any errors."
    steps_key: steps
    error_types:
      - {name: reasoning, subtypes: [logical_error, factual_error, planning_error]}
      - {name: execution, subtypes: [wrong_tool, wrong_args, api_error]}
    severities:
      - {name: minor, weight: -1}
      - {name: major, weight: -5}
    show_score: true

如何設計錯誤分類體系,見標註智慧體軌跡

Potato 在智慧體上不做的事

  • 它不是生產監控服務。 它有支援 OpenTelemetry 匯出的追蹤 SDK,但沒有託管雲,也沒有為生產流量的延遲和成本設計的看板。它只能自行部署。
  • 不提供稽核人員。 請自帶稽核者,或在 Prolific 上招募。

常見問題

在人工稽核方面,LangSmith 和 Langfuse 有什麼區別?

兩者都通過標註佇列給軌跡和 span 附加人工分數。LangSmith 是專有軟體,在 Enterprise 方案下可以自行部署,支援每次執行多名稽核者和成對比較佇列。Langfuse 採用 MIT 許可證,可以免費自行部署;在其論壇上,有使用者反映兩個人還不能在同一個佇列裡獨立給同一條軌跡打分。兩者的文件都沒有提供人工稽核者之間一致性的統計。

智慧體評估有沒有 LangSmith 的開源替代品?

在追蹤和打分方面,Langfuse(MIT)和 Comet Opik(Apache-2.0)都是開源的,可以免費自行部署。對於人工評估研究,即每條軌跡多名稽核者、逐步標籤和一致性,Potato 是開源且免費的。Potato 能讀取 LangSmith 和 Langfuse 的匯出,因此可以與兩者中的任何一個配合使用。

如何衡量人工稽核者在智慧體軌跡上的一致性?

每條軌跡至少分給兩名互相看不到對方標籤的稽核者,然後按問題分別計算:兩名稽核者用 Cohen κ,多於兩名用 Krippendorff α。逐步標籤需要先把步驟對應起來。係數的選擇見標註者間一致性詳解

能在 Potato 中使用來自 LangSmith 或 Langfuse 的軌跡嗎?

能。python -m potato.trace_converter--input-format langchain 轉換 LangSmith 的執行匯出,用 --input-format langfuse 轉換 Langfuse 的匯出。生產追蹤保持原樣,只把需要評判的軌跡匯入 Potato。

延伸閱讀