Skip to content

Agent Evaluation

查詢有關 Potato 的常見問題解答。沒有找到您需要的答案?請加入我們的 Discord 或查閱文件。

Agent Evaluation

可以。Potato 原生支援 Claude Code、OpenCode、Cursor、Aider 和 SWE-Agent 的軌跡轉換器。工具呼叫使用專門設計的 UI 呈現:Edit/Write 顯示為紅綠統一差異檢視,Bash 顯示為深色等寬終端塊,Read/Grep 顯示為帶行號的程式碼,以及按操作類型分組的檔案樹側邊欄。長輸出會自動摺疊。

可以。Potato 包含 Web Agent 顯示元件,帶有用於點選標記、邊界框、滑鼠軌跡和滾動指示器的 SVG 疊加層。提供兩種模式:Review Mode 用於通過膠片條導航預先錄製的截圖,Creation Mode 用於基於 iframe 的即時網頁瀏覽並自動記錄互動。提供 WebArena、Mind2Web 和 Anthropic Computer Use 格式的軌跡轉換器。

可以。Potato 把一次多智慧體執行渲染為一張由智慧體和交接構成的可點選互動圖,並提供相應的 schema,用以把失敗歸因到負有責任的智慧體和步驟、審查每一次交接以發現智慧體間的失配、為每個智慧體和整個團隊打分,以及標記跨智慧體的工具爭用和湧現行為。參見多智慧體團隊評估文件。

可以。Potato 為多模態智慧體提供專門構建的 schema:帶逐步截圖和點選定位的 GUI/computer-use 軌跡、帶打斷檢測的全雙工語音時間線、對照模型預測給出即時 IoU 的影片時間定位、對齊的語音轉錄錯誤標記、交錯式多模態推理,以及文件表格網格結構。參見多模態智慧體評估文件。

可以。Live Agent 模式將 LLM 視覺模型(通過 Playwright 連線的 Anthropic Claude)與無頭瀏覽器相連。代理截圖,LLM 規劃動作,Potato 通過 Server-Sent Events 將會話流式傳輸給標註者。標註者可以在會話中途暫停、傳送指令或接管手動控制。通過 `live_agent` 顯示類型進行配置。

可以。編碼代理模式支援在任意步驟進行檢查點/回退,並支援用於探索替代軌跡的分支/重放。這對反事實評估、代理決策的 A/B 比較,以及標註者迭代地完善代理執行以收集高品質訓練資料非常有用。

可以。trajectory_eval 模式(基於 TRAIL 和 AgentRewardBench)將每個步驟顯示為一張卡片。標註者標記正確性,從帶有子類型(推理、執行、安全等)的可配置分類法中歸類錯誤類型,用加權分數分配嚴重程度,並撰寫每步的理由。自動計算的品質分數會彙總整條軌跡中的嚴重性懲罰。

可以。Potato 提供面向編碼代理步驟級評估的過程獎勵模式和程式碼評審模式。這兩種標註類型都可以直接匯出為 PRM 和 DPO 格式,用於下游 RLHF 訓練。請參見 coding-agent-evaluation 示例項目。

可以。LLM Chat Sidebar 是一個可摺疊的 AI 助手面板,支援多輪對話。它將任務描述、標籤集合和當前實例文本作為上下文。原生支援 OpenAI、Anthropic 和 Ollama 的多輪對話。所有對話都會作為行為資料被記錄下來,以便後續分析標註者與 LLM 的協作情況。

Yes. Potato converts LangChain/LangSmith traces automatically.

可以。安裝 `pip install potato-annotation[langchain]`,然後將 `PotatoCallbackHandler` 附加到您的鏈上。它會跟蹤父子級的鏈/LLM/工具呼叫,並在根鏈完成時向 Potato 傳送與 LangSmith 相容的負載。結合 webhook 接收器,無需手動匯出即可將即時代理軌跡送入標註佇列。

三個類別共 13 種格式。**框架**:LangChain、LangFuse、OpenAI、Anthropic、MCP (Model Context Protocol)、OpenTelemetry、ATIF。**Web 代理**:WebArena、原始 web 軌跡。**編碼代理**:Claude Code、Aider、SWE-Agent。此外還提供使用 `structured_turns` 模式的通用 JSONL 攝取通道,可適配任意自定義格式。完整列表請見 /integrations。

可以。在編碼代理項目中,你可以在同一條軌跡上疊加 trajectory_eval(每步錯誤)、span 標註(突出代理推理中的幻覺)、pairwise 比較(哪個代理更好)以及 likert 評分(整體品質)。Potato 的多模式架構讓標註者在同一介面中看到針對同一條軌跡的所有模式。

No. The live agent supports Ollama for fully local inference with no API key.

Yes. Potato supports CrewAI, AutoGen, and LangGraph trace formats.

Use the generic ReAct converter or the webhook API to send traces in any JSON format.

Yes. Live agent mode lets annotators pause the agent, send instructions, or take over manual control.

Use the agent_eval exporter: python -m potato.export -f agent_eval -o results/.

還有其他問題?

我們的社群隨時為您提供幫助。加入 Discord 獲取即時支援,或瀏覽文件獲取詳細指南。