Skip to content

評估 computer-use 與多模態智慧體

如何對 computer-use 與 GUI 智慧體,以及語音、影片和文件智慧體進行人工評估:評判每個動作和點選、為輪流發言打分,以及在時間上定位事件。

一個 computer-use 智慧體像人一樣操控圖形介面:它讀取一張截圖,決定一個動作(點選、輸入、滾動)並執行。評估它意味著逐步檢查每個動作是否正確、點選是否真的落在了目標元素上,而不只是任務最終是否成功。 Potato 是一款用於對 computer-use、GUI、語音、影片和文件智慧體進行人工評估的開源工具,為每種模態提供專門構建的標註介面

一個 computer-use 智慧體(也稱 GUI 或 OS 智慧體)將螢幕感知為畫素或 DOM,並通過使用者擁有的同一套控制元件來行動。像 OSWorld、ScreenSpot 和 AndroidWorld 這樣的基準會自動為任務成功打分;人工審查補上自動化所遺漏的東西,比如那個碰巧產生了正確結果的動作,或那個點錯了按鈕卻仍然推進了任務的點選。

在一條 computer-use 軌跡中你要評判什麼?

每一步把一張截圖(智慧體所看到的)與一個動作(它所做的)配對。標註者評判該動作,並在該步帶有點選座標時檢查截圖上的定位標記:

  • 動作正確性:正確、錯誤元素、錯誤動作,或幻覺。
  • 點選定位:座標是否落在了動作所指名的元素上?
  • 結果:執行是否完成了任務,它最先在哪一步出錯?
yaml
annotation_schemes:
  - annotation_type: gui_trajectory
    name: gui_review
    description: "For each step: was the action correct and did the click land right?"
    steps_key: steps
    screenshot_key: screenshot
    action_key: action
    coord_space: normalized
    verdict_options: [correct, wrong_element, wrong_action, hallucinated]

捕捉到第一個出錯的步驟比單一的通過/失敗更重要,因為正是那一步是你要修復或用來訓練的物件;參見過程獎勵模型

我如何評估語音智慧體的輪流發言?

語音智慧體在回合的銜接處失敗:打斷使用者、與使用者搶話,或停頓過久。voice_interaction schema 將對話佈局為一條雙軌時間線,並高亮兩位說話者同時說話的重疊區域,標註者對這些區域進行分類(智慧體應當回應、應當繼續、屬於附和,還是不明確),然後為整體輪流發言評分。這是一段扁平的對話記錄無法表達的全雙工檢視。

我如何為影片和文件智慧體打分?

  • 影片時間定位:對每個事件提示,標出黃金 [start, end] 區間;當資料包含模型預測的區間時,一個即時 IoU 會隨你調整而更新,因此你直接對定位評分。
  • 語音轉錄:逐片段標記 ASR/TTS 錯誤並內聯修正文本。
  • 文件表格:標記邊界框無法捕捉的單元格結構(列表頭、行表頭、資料、空)。
  • 交錯式推理:為文本-影像-工具軌跡的每一步評定連貫性,並標記視覺幻覺。

每一項都是多模態智慧體參考中的一個獨立 schema,且其中數個可以在同一項任務上執行。

我該使用哪個 schema?

智慧體類型Schema你標註什麼
Computer-use / GUIgui_trajectory動作正確性 + 點選定位
語音 / 口語voice_interaction打斷處理與輪流發言
影片temporal_grounding黃金事件區間 vs. 預測(IoU)
語音轉錄speech_transcript每片段的 ASR/TTS 錯誤
文件 / 表格table_grid單元格結構角色
多模態推理multimodal_reasoning步驟連貫性與視覺幻覺

延伸閱讀