評估 computer-use 與多模態智慧體
如何對 computer-use 與 GUI 智慧體,以及語音、影片和文件智慧體進行人工評估:評判每個動作和點選、為輪流發言打分,以及在時間上定位事件。
一個 computer-use 智慧體像人一樣操控圖形介面:它讀取一張截圖,決定一個動作(點選、輸入、滾動)並執行。評估它意味著逐步檢查每個動作是否正確、點選是否真的落在了目標元素上,而不只是任務最終是否成功。 Potato 是一款用於對 computer-use、GUI、語音、影片和文件智慧體進行人工評估的開源工具,為每種模態提供專門構建的標註介面。
一個 computer-use 智慧體(也稱 GUI 或 OS 智慧體)將螢幕感知為畫素或 DOM,並通過使用者擁有的同一套控制元件來行動。像 OSWorld、ScreenSpot 和 AndroidWorld 這樣的基準會自動為任務成功打分;人工審查補上自動化所遺漏的東西,比如那個碰巧產生了正確結果的動作,或那個點錯了按鈕卻仍然推進了任務的點選。
在一條 computer-use 軌跡中你要評判什麼?
每一步把一張截圖(智慧體所看到的)與一個動作(它所做的)配對。標註者評判該動作,並在該步帶有點選座標時檢查截圖上的定位標記:
- 動作正確性:正確、錯誤元素、錯誤動作,或幻覺。
- 點選定位:座標是否落在了動作所指名的元素上?
- 結果:執行是否完成了任務,它最先在哪一步出錯?
annotation_schemes:
- annotation_type: gui_trajectory
name: gui_review
description: "For each step: was the action correct and did the click land right?"
steps_key: steps
screenshot_key: screenshot
action_key: action
coord_space: normalized
verdict_options: [correct, wrong_element, wrong_action, hallucinated]捕捉到第一個出錯的步驟比單一的通過/失敗更重要,因為正是那一步是你要修復或用來訓練的物件;參見過程獎勵模型。
我如何評估語音智慧體的輪流發言?
語音智慧體在回合的銜接處失敗:打斷使用者、與使用者搶話,或停頓過久。voice_interaction schema 將對話佈局為一條雙軌時間線,並高亮兩位說話者同時說話的重疊區域,標註者對這些區域進行分類(智慧體應當回應、應當繼續、屬於附和,還是不明確),然後為整體輪流發言評分。這是一段扁平的對話記錄無法表達的全雙工檢視。
我如何為影片和文件智慧體打分?
- 影片時間定位:對每個事件提示,標出黃金
[start, end]區間;當資料包含模型預測的區間時,一個即時 IoU 會隨你調整而更新,因此你直接對定位評分。 - 語音轉錄:逐片段標記 ASR/TTS 錯誤並內聯修正文本。
- 文件表格:標記邊界框無法捕捉的單元格結構(列表頭、行表頭、資料、空)。
- 交錯式推理:為文本-影像-工具軌跡的每一步評定連貫性,並標記視覺幻覺。
每一項都是多模態智慧體參考中的一個獨立 schema,且其中數個可以在同一項任務上執行。
我該使用哪個 schema?
| 智慧體類型 | Schema | 你標註什麼 |
|---|---|---|
| Computer-use / GUI | gui_trajectory | 動作正確性 + 點選定位 |
| 語音 / 口語 | voice_interaction | 打斷處理與輪流發言 |
| 影片 | temporal_grounding | 黃金事件區間 vs. 預測(IoU) |
| 語音轉錄 | speech_transcript | 每片段的 ASR/TTS 錯誤 |
| 文件 / 表格 | table_grid | 單元格結構角色 |
| 多模態推理 | multimodal_reasoning | 步驟連貫性與視覺幻覺 |
延伸閱讀
- 多模態智慧體評估 — 完整的 schema 參考
- 網頁智慧體評估 — 截圖與動作型網頁智慧體
- 如何評估 AI 智慧體 — 智慧體評估的各個層級
- 如何評估多智慧體系統