Skip to content
Guides1 min read

評估語音與影片智慧體

在 Potato 中對口語、影片和文件智慧體做人工評估的一次演練:在雙軌時間線上給輪流發言打分、用即時 IoU 為影片事件定位、標記語音錯誤,以及標出表格結構。

Potato Team

會說話、看影片、讀文件的智慧體,會以文本框無法呈現的方式出錯。一個語音智慧體的失誤活在回合之間的接縫處;一個影片智慧體的答案是一個時間區間,而不是一句話;一個文件智慧體的錯誤是一個誤讀的表格單元。這些每一種都需要一個為該模態量身打造的審查介面。 Potato 在已有的 影像音訊 展示之外,新增了四個這樣的介面——語音、影片、語音轉寫和文件。完整參考是 多模態智慧體評估

每個模態都有自己的審查介面:語音、影片、語音轉寫和文件一個普通文本控制元件無法表達一次打斷、一個事件區間或一個表格單元

我怎麼評估一個語音智慧體的輪流發言?

口語智慧體在邊界處出問題:打斷使用者、和使用者搶話,或者停頓太久以至於使用者放棄。voice_interaction 方案把對話排布成一條雙軌時間線——一條使用者泳道和一條智慧體泳道——並高亮兩者同時說話的重疊區域(Full-Duplex-Bench,2025)。你對每一處重疊分類,併為整體的輪流發言打分;提供音訊時會內嵌播放。

一條帶高亮打斷區域的雙軌語音時間線帶打斷檢測與輪流發言評分的雙軌語音時間線

yaml
annotation_schemes:
  - annotation_type: voice_interaction
    name: turn_taking
    description: "Classify each barge-in/overlap and rate the overall turn-taking."
    turns_key: turns
    speaker_key: speaker
    user_speakers: [user, human, caller]
    overlap_labels: [agent_should_respond, agent_should_resume, backchannel, uncertain]
    rating_scale: 5

這些重疊在渲染時根據回合的時序計算得出,於是一段會被扁平記錄壓成“他們倆都說了些話”的 全雙工 對話,就變成了一組具體、可打標籤的時刻。

我怎麼給一個影片智慧體的時間定位打分?

一個影片智慧體對“目標什麼時候發生?”的回答是一個區間,所以你也把它當作區間來打分。temporal_grounding 方案給你一個拖動條,你在上面為每個事件提示標出黃金的 [start, end],方式是捕捉播放頭或輸入秒數。當資料帶有模型的預測區間時,隨著你調整,一個即時的 IoU 和一條雙條迷你時間線會同步更新(TimeScope,2025)。

一個帶黃金區間和即時 IoU 讀數的影片拖動條在影片上標出黃金事件區間,並即時顯示相對模型預測的 IoU

這是為預測與黃金的定位對比而打造的,這和一般的片段標註是不同的活兒:你在給模型的跨度離真相有多近打分,而看著 IoU 隨你拖動邊界而移動,讓這件事變得即時可感。

那語音轉寫、推理和表格呢?

還有三個介面覆蓋了多模態領域的其餘部分:

  • 語音轉寫speech_transcript):每一個時間對齊的片段都是一張卡片;你標記 ASR/TTS 錯誤、發音錯誤和不流暢,並就地修正文本(Speak & Improve,2025)。這是對輪流發言檢視在片段層級上的補充。
  • 交錯推理multimodal_reasoning):一條文本-影像-工具的軌跡被渲染成帶類型的塊;你為每一步的連貫性打分,並標記那些推理與影像不相符的視覺幻覺(Multimodal RewardBench 2,2025)。
  • 文件表格table_grid):你設定網格尺寸並點選單元格以標出它們的角色——資料、列表頭、行表頭、空——從而捕捉邊界框無法捕捉的結構。

帶每片段錯誤標籤和就地修正的語音轉寫片段為每個片段標記 ASR/TTS/發音錯誤,並就地修正轉寫文本

yaml
annotation_schemes:
  - annotation_type: speech_transcript
    name: speech_errors
    description: "Tag speech errors on each segment and correct the transcript where needed."
    segments_key: segments
    error_types: [asr_error, tts_artifact, mispronunciation, disfluency]
    allow_correction: true

一條帶被標記的視覺幻覺的交錯推理軌跡為一條文本-影像-工具推理軌跡的每一步評判連貫性與視覺幻覺

這些方案中有幾個可以在同一個任務上執行,所以一次文件智慧體的執行可以同時被評分表格結構和推理連貫性。

一張表格影像,其單元格被標為表頭、資料和空標註文件表格的單元格結構:列表頭與行表頭、資料和空單元格

我怎麼把它搭起來?

每個介面都在 examples/agent-traces/ 下附帶一個可執行示例:

bash
pip install --upgrade potato-annotation
python potato/flask_server.py start examples/agent-traces/temporal-grounding/config.yaml -p 8000

你的資料以帶時間戳的回合、片段或事件的形式接入;介面會在渲染時從中推匯出自己的時間線。對於 GUI 和作業系統智慧體,配套的篇章是 評估計算機操作智慧體

延伸閱讀