編碼智慧體評估
如何評估編碼智慧體,審閱 diff、終端輸出以及 SWE-bench/Aider/Claude Code 軌跡,並藉助 Potato 的編碼軌跡展示功能。
編碼智慧體會編輯檔案、執行命令、讀取輸出來解決一項程式設計任務。評估它就像審閱一個同時包含終端會話的拉取請求:你既要評判程式碼改動,也要評判產生這些改動的步驟。 用 Potato 標註 SWE-agent、Aider 和 Claude Code 的軌跡,它是一款免費、可自託管的工具,會渲染 diff 和終端塊供審閱。
這與 SWE-bench 等自動化基準互為補充;人工審閱能抓出那些看似合理卻錯誤、並騙過了薄弱測試的補丁。
在編碼智慧體執行中,標註者審閱什麼?
- Diff:每個檔案改動的彩色統一 diff,帶行號和檔案樹側邊欄。
- 命令與輸出:展示智慧體運行了什麼、返回了什麼的終端塊。
- 推理:智慧體在各步動作之間的思考過程。
Potato 可讀取編碼智慧體軌跡,包括 SWE-bench、Aider 和 Claude Code 格式。參見編碼智慧體標註和程式碼審查標註。
在編碼智慧體執行中,我該評判什麼?
- 正確性:這次改動是否在不破壞其他部分的前提下解決了任務?
- 步驟品質:每次編輯/命令是合理的,還是在亂撞?
- 效率:它走的路徑是否合理?
yaml
annotation_schemes:
- annotation_type: trajectory_eval
name: step_correctness
description: "Judge each edit or command."
steps_key: agentic_steps
correctness_options: ["Correct", "Partially correct", "Incorrect", "Unnecessary"]
- annotation_type: radio
name: overall
description: "Does the final change solve the task?"
labels: [Solved, Partially solved, Not solved]