Skip to content

編碼智慧體評估

如何評估編碼智慧體,審閱 diff、終端輸出以及 SWE-bench/Aider/Claude Code 軌跡,並藉助 Potato 的編碼軌跡展示功能。

編碼智慧體會編輯檔案、執行命令、讀取輸出來解決一項程式設計任務。評估它就像審閱一個同時包含終端會話的拉取請求:你既要評判程式碼改動,也要評判產生這些改動的步驟。 用 Potato 標註 SWE-agent、Aider 和 Claude Code 的軌跡,它是一款免費、可自託管的工具,會渲染 diff 和終端塊供審閱。

這與 SWE-bench 等自動化基準互為補充;人工審閱能抓出那些看似合理卻錯誤、並騙過了薄弱測試的補丁。

在編碼智慧體執行中,標註者審閱什麼?

  • Diff:每個檔案改動的彩色統一 diff,帶行號和檔案樹側邊欄。
  • 命令與輸出:展示智慧體運行了什麼、返回了什麼的終端塊。
  • 推理:智慧體在各步動作之間的思考過程。

Potato 可讀取編碼智慧體軌跡,包括 SWE-bench、Aider 和 Claude Code 格式。參見編碼智慧體標註程式碼審查標註

在編碼智慧體執行中,我該評判什麼?

  • 正確性:這次改動是否在不破壞其他部分的前提下解決了任務?
  • 步驟品質:每次編輯/命令是合理的,還是在亂撞?
  • 效率:它走的路徑是否合理?
yaml
annotation_schemes:
  - annotation_type: trajectory_eval
    name: step_correctness
    description: "Judge each edit or command."
    steps_key: agentic_steps
    correctness_options: ["Correct", "Partially correct", "Incorrect", "Unnecessary"]
  - annotation_type: radio
    name: overall
    description: "Does the final change solve the task?"
    labels: [Solved, Partially solved, Not solved]

如何讓編碼智慧體評估保持可靠?

  • 把任務描述和程式碼倉庫上下文一併給標註者;脫離目標的 diff 毫無意義。
  • 關於首個錯誤的推理鏈,參見過程獎勵模型
  • 若想即時觀看智慧體編碼而非審閱錄製內容,參見即時智慧體評估

延伸閱讀