Potato 2.6.2:一套完整的開源智慧體評估工具
2.6.x 系列把 Potato 打造成一個完整、免費的智慧體評估平臺:支援從 OpenTelemetry、LangGraph、CrewAI 和 AutoGen 攝取軌跡,支援帶可點選互動圖的多智慧體團隊標註,支援面向 GUI、語音和影片的多模態智慧體方案,外加模型競技場、CI 門禁和資料篩選。
Potato 2.6 帶來了智慧體評估的第一波能力:LLM 作為評判者的校準、用於訓練資料的軌跡編輯,以及三欄式的 eval_trace 展示。此後的 2.6.x 小版本補齊了其餘部分。到 2.6.2 為止,Potato 已是一個完整的智慧體評估平臺:你可以從自己的智慧體捕獲軌跡,標註單個智慧體、多智慧體團隊和多模態智慧體,用你可以信賴的 LLM 來評判它們,在競技場中給模型排名,並在 CI 中對釋出設卡。這一切都用 YAML 配置,並始終執行在你自己的伺服器上。
Potato 多智慧體評估
這些能力中,大多數都是人們如今要向託管平臺付費才能獲得的。Potato 免費提供,並且自託管。下面是 2.6.x 系列釋出的全部內容。
端到端的 2.6.x 智慧體評估工具
把軌跡接進來:一個捕獲 SDK 與開放標準
評估始於真實的執行。新的 potato_trace SDK 可以為任何智慧體埋點:用 @traceable 裝飾一個函式(同步或非同步),巢狀呼叫便會被捕獲併發送到 Potato 的攝取端點,還可選擇匯出到 OpenTelemetry。Potato 同樣能攝取 OpenTelemetry / OpenInference span,以及 LangGraph、CrewAI 和 AutoGen 的執行格式,因此你已經在用的框架產出的軌跡無需膠水程式碼就能進入標註佇列。新軌跡可以通過 webhook、輪詢器或被監視的目錄到達,並在落地時就能分配給標註者。
看見整個團隊:多智慧體評估
這是沒有開源對等物的部分。多智慧體執行的失敗方式與單個智慧體不同:發生在智慧體之間、在某次交接處、或在團隊的組織方式裡。所以 Potato 標註的是團隊結構,而不是一份扁平的對話記錄:
- 一張可點選的、由智慧體與交接構成的互動圖,你在上面標出關鍵路徑並標記有問題的邊。
- 失敗歸因:選出該負責的智慧體、決定性的步驟和原因——即來自 Who&When 歸因工作的(智慧體、步驟、原因)三元組。
- 交接審查:每一次控制權轉移都成為一張卡片,用來標記智慧體間的不一致並給品質打分。
- 每個智慧體與每個團隊的記分卡:每個智慧體的角色忠實度、貢獻度和協作度,加上共享的團隊維度與里程碑。
- 一條工具爭用時間線,用來揭示多個智慧體同時觸碰同一資源時產生的死鎖與競態。
- 湧現行為標記,用於跨多個智慧體與多個回合的共謀、群體思維和級聯錯誤。
失敗歸因:哪個智慧體、哪一步、為什麼
包含各自 YAML 的完整集合見 多智慧體團隊評估,深入解析 除錯多智慧體失敗 會逐一走完每個介面。指南 如何評估多智慧體系統 講解了何時該用哪一種。
超越文本:多模態智慧體評估
智慧體如今會操作 GUI、觀看影片、進行口語對話,而每一種都需要文本控制元件無法提供的審查介面:
- GUI / 計算機操作軌跡:每一步的截圖與動作、一個動作裁定,以及一個點選落點標記,用來顯示點選是否落在了正確的元素上。
- 全雙工語音時間線:一條雙軌使用者/智慧體時間線,帶打斷檢測與輪流發言評分。
- 影片時間定位:標出黃金事件區間,並對模型預測區間即時計算 IoU。
- 語音轉寫錯誤標記、帶視覺幻覺標記的交錯多模態推理,以及文件表格網格結構。
計算機操作審查:動作正確性加上點選落點
兩篇深入解析會逐一講解這些內容:評估計算機操作智慧體 針對 GUI 和作業系統智慧體,評估語音與影片智慧體 針對口語、影片和文件智慧體。參考文件是 多模態智慧體評估,指南是 評估計算機操作與多模態智慧體。
你可以信賴的評判者,以及一個競技場
用 LLM 給輸出打分早已是家常便飯;2.6.x 的工作在於搞清楚能信它到什麼程度。評判者校準 讓人在不知模型標籤的情況下盲標一遍,並報告準確率、kappa 和期望校準誤差(ECE)。評判者對齊 針對你的黃金標籤來調一個評判者。而程式化評估器 無需伺服器執行即可自動給軌跡和文本打分(軌跡匹配、工具使用正確性、無參照的 LLM 作為評判者,以及啟發式規則)。
要做正面對決,模型競技場 把同一個提示發給多個模型,收集偏好,並在 OpenAI、Anthropic、Gemini、Ollama 和 vLLM 之間構建一張勝率排行榜。
把評估當軟體來對待
這些運維部件讓評估可重複:
- 資料集與實驗:帶版本的評估集、切分,以及帶回歸差值的並排實驗對比。
- CI 評估:一個 pytest 外掛,當某次提示或模型改動讓智慧體品質回退超過閾值時讓構建失敗。
- 自動化規則:按規則把進入的生產軌跡路由到資料集、評估器或標註佇列。
- 語義篩選:一個嵌入索引,用於“找出和這次失敗相似的軌跡”,以及可儲存的動態切片。
如何獲取
pip install --upgrade potato-annotation每個新介面都在 examples/agent-traces/ 下附帶一個可執行示例,包括 interaction-graph/、failure-attribution/、gui-trajectory/ 和 temporal-grounding/。讓 Potato 指向其中之一,就能看到方案執行起來:
python potato/flask_server.py start examples/agent-traces/interaction-graph/config.yaml -p 8000如果你在權衡工具選型,Potato 對比 LangSmith 與 Langfuse 中的對照,以及指南 開源標註工具對比,都梳理了各自適合的場景。歡迎在 GitHub 倉庫 提出問題以及我們應當支援的軌跡格式。