世界模型與機器人回合評估工具對比
評估生成影片、世界模型和機器人回合所用的基準、視覺化工具和標註工具:VBench、WorldModelBench、Physics-IQ、ATLAS、Rerun 與 Potato。
世界模型和影片生成模型用 VBench、WorldModelBench、Physics-IQ 等基準來評估,這些基準規定了要測量什麼,並提供自動評分器。這些自動評分器要用人工判斷來檢驗。收集站得住腳的人工判斷,也就是讓評分者不知道影片出自哪個模型,並報告他們之間的一致性,這是標註工作。Potato 提供了評判生成的推演結果(rollout)和切分機器人回合的方案。
世界模型預測一個場景會如何變化,通常以某個動作為條件;影片生成模型也可以作為世界模型來評估,看它的輸出是否遵循物理規律、是否執行了給定的指令。一次推演(rollout)是一段生成的後續畫面。機器人回合是完成一項任務的一次嘗試的記錄,通常包括多路攝像頭畫面,以及關節位置、夾爪狀態等訊號。
本頁討論世界模型、生成影片和機器人。所有資料類型放在一頁裡的對比見 AI 標註工具對比。
各工具的作用
| 工具 | 是什麼 | 人在哪裡參與 |
|---|---|---|
| VBench | 影片生成基準套件,Apache-2.0 | 每個維度都有人工偏好標註,用來檢驗自動分數是否與人一致 |
| WorldModelBench | 把影片生成模型當作世界模型來評估的基準 | 通過眾包收集的 67,000 條人工標籤,也用於訓練一個自動評審 |
| Physics-IQ | Google DeepMind 推出的生成影片物理理解基準 | 一個分數和一個排行榜 |
| ATLAS | 用於長時程動作切分的桌面工具,支援 ROS bag 和 RLDS | 每個回合一名標註者 |
| Rerun、Foxglove | 機器人視覺化 | 用於檢視,不用於標註研究 |
| ELAN、BORIS | 影片中的行為編碼 | ELAN 報告標註者間信度 |
| CVAT、Label Studio | 通用影片標註 | 軌跡和時間軸標籤,沒有世界模型方案 |
| Potato | 帶有 rollout_evaluation 和 episode_annotation 方案的標註工具 | 每個條目多名標註者、盲評面板、報告一致性 |
基準確定評估協議
VBench 在 16 個維度上給文本生成影片模型打分,包括主體一致性、運動平滑度和空間關係。VBench-2.0 又增加了 18 個維度,涉及常識、物理、人體運動和構圖。作者為每個維度收集了人工偏好標註,並表明自動分數與之吻合。
WorldModelBench 從指令遵循和物理遵循兩方面評估影片生成模型,能發現諸如物體大小變化違背品質守恆之類的違規。作者通過眾包收集了 67,000 條人工標籤,用來評估 14 個前沿模型,隨後微調了一個 20 億參數的評審模型,它預測世界建模違規的準確率比 GPT-4o 高 8.6%(arXiv 2502.20694)。
Physics-IQ 涵蓋固體力學、流體力學、光學、熱力學和磁學。作者測試了 Sora、Runway、Pika、Lumiere、Stable Video Diffusion 和 VideoPoet,發現這些模型的物理理解非常有限,而且與畫面的逼真程度無關(arXiv 2501.09038)。
指標和參考協議請用這些基準。任何結果最終都要和它們對比。
人工判斷在哪裡起作用
VBench 用人工判斷來驗證它的各個維度,WorldModelBench 用人工判斷來訓練它的評審模型。評估自己的模型時,每出一個新檢查點,人工部分都要重做一遍。這時它就會遇到所有標註研究都有的問題:評分者知道哪個影片出自哪個模型,評分者對什麼算違規意見不一,也沒有一致性數字來證明這些標籤可信。
在 Potato 中評判生成的推演
rollout_evaluation 方案把兩段或更多推演放在同一個時鐘上顯示。標註者標出世界開始不合理的那一幀,標註是哪種物理或因果屬性被破壞了,按評分細則給出偏好,並判斷在給定干預下某個反事實分岔是否合理。面板可以隱藏模型身份,並按每位標註者固定的順序打亂,重新整理頁面也不會暴露哪個是哪個模型。
破綻點上的一致性分三方面報告:標註者是否發現了破綻、把它標在哪裡、給了什麼類別。匹配容差以多個取值的掃描來展示,而不是隻取一個閾值。
annotation_schemes:
- annotation_type: rollout_evaluation
name: rollout_review
description: "Where does each rollout stop making sense?"
streams:
- {field: real, name: "Recording", role: real}
- {field: gen_a, name: "Model A"}
- {field: gen_b, name: "Model B"}
fps: 25
layers: [violations, preference, counterfactual]
blind: true
shuffle: true
require_clean: truerequire_clean 把"沒有破綻"變成一個明確的答案,這樣就能區分沒人標記的推演和沒人看完的推演。見如何評估生成影片與世界模型。
標註機器人回合
episode_annotation 方案把多路同步影片和機器人的時間序列通道(關節位置、夾爪狀態、力與力矩、獎勵)放在同一條時間軸上。標註者切分階段、標註每個階段的結果、繪製稠密的進度獎勵,並事後重寫指令。Potato 可以匯入 LeRobot v2、HDF5(RoboMimic 和 ALOHA)以及 RLDS/TFDS,並按幀寫出一個 JSONL 附屬檔案,因此不必改寫只讀的公開資料集。
一致性的報告方式是:階段邊界用時間 IoU,結果標籤用 α,獎勵曲線用 ICC 加 Pearson 相關,同時註明覆蓋率,因為只在時間軸 5% 上算出的相關,對其餘部分說明不了什麼。
維也納工業大學的 ATLAS 是一個用於長時程動作切分的桌面工具,能直接讀取 ROS bag 和 RLDS。對於由一名標註者精確放置邊界的工作,它是專門為此打造的。它發表的結果表明,在影片旁邊顯示本體感覺時間序列,比只看影片能減少邊界誤差;這正是 Potato 顯示這些通道的原因。Rerun 和 Foxglove 是最好的機器人視覺化工具,行為編碼方面 ELAN 和 BORIS 仍是標準。見如何標註機器人回合。
視覺語言模型的定位與指點評估,見VLM 定位評估。
Potato 在這方面不做的事
- 沒有自動的物理評分器。 這部分請用基準自帶的評分器,Potato 用來收集檢驗它的人工標籤。
- 不訓練模型,也不做推理。 Potato 顯示的是你生成的推演。
- 不支援點雲序列。 3D 標註按幀進行。
以上內容於 2026 年 8 月和 9 月對照各項目的程式碼倉庫和論文核實。
常見問題
世界模型是如何評估的?
用 VBench、WorldModelBench、Physics-IQ 這類基準,從物理遵循、指令遵循和畫面品質方面給生成影片打分,再用人工判斷來驗證或訓練這些評分器。對一個新模型來說,人工部分就是讓人觀看推演,在不知道出自哪個模型的情況下,標出它們在物理上開始不合理的位置,並相互比較。
哪些世界模型基準使用了人工判斷?
VBench 為每個維度都收集了人工偏好標註,以表明它的自動分數與人一致。WorldModelBench 通過眾包在 14 個模型上收集了 67,000 條人工標籤,並用它們微調了一個自動評審模型。
標註機器人回合可以用什麼工具?
ATLAS 是供一名標註者從 ROS bag 或 RLDS 中切分長回合的桌面工具。Potato 讓多名標註者在瀏覽器中標註回合,能匯入 LeRobot v2、HDF5 和 RLDS/TFDS,並報告階段邊界、結果和獎勵曲線上的一致性。
如何衡量評判生成影片的人之間的一致性?
每段推演至少由兩名不知道它出自哪個模型的評分者評判。報告他們是否一致認為出現了破綻、在多個容差下破綻點有多接近,以及是否給出了相同的類別。Potato 的 rollout_evaluation 會分別報告這三項。