Skip to content

世界模型與機器人回合評估工具對比

評估生成影片、世界模型和機器人回合所用的基準、視覺化工具和標註工具:VBench、WorldModelBench、Physics-IQ、ATLAS、Rerun 與 Potato。

世界模型和影片生成模型用 VBench、WorldModelBench、Physics-IQ 等基準來評估,這些基準規定了要測量什麼,並提供自動評分器。這些自動評分器要用人工判斷來檢驗。收集站得住腳的人工判斷,也就是讓評分者不知道影片出自哪個模型,並報告他們之間的一致性,這是標註工作。Potato 提供了評判生成的推演結果(rollout)和切分機器人回合的方案。

世界模型預測一個場景會如何變化,通常以某個動作為條件;影片生成模型也可以作為世界模型來評估,看它的輸出是否遵循物理規律、是否執行了給定的指令。一次推演(rollout)是一段生成的後續畫面。機器人回合是完成一項任務的一次嘗試的記錄,通常包括多路攝像頭畫面,以及關節位置、夾爪狀態等訊號。

本頁討論世界模型、生成影片和機器人。所有資料類型放在一頁裡的對比見 AI 標註工具對比

各工具的作用

工具是什麼人在哪裡參與
VBench影片生成基準套件,Apache-2.0每個維度都有人工偏好標註,用來檢驗自動分數是否與人一致
WorldModelBench把影片生成模型當作世界模型來評估的基準通過眾包收集的 67,000 條人工標籤,也用於訓練一個自動評審
Physics-IQGoogle DeepMind 推出的生成影片物理理解基準一個分數和一個排行榜
ATLAS用於長時程動作切分的桌面工具,支援 ROS bag 和 RLDS每個回合一名標註者
RerunFoxglove機器人視覺化用於檢視,不用於標註研究
ELANBORIS影片中的行為編碼ELAN 報告標註者間信度
CVATLabel Studio通用影片標註軌跡和時間軸標籤,沒有世界模型方案
Potato帶有 rollout_evaluationepisode_annotation 方案的標註工具每個條目多名標註者、盲評面板、報告一致性

基準確定評估協議

VBench 在 16 個維度上給文本生成影片模型打分,包括主體一致性、運動平滑度和空間關係。VBench-2.0 又增加了 18 個維度,涉及常識、物理、人體運動和構圖。作者為每個維度收集了人工偏好標註,並表明自動分數與之吻合。

WorldModelBench 從指令遵循和物理遵循兩方面評估影片生成模型,能發現諸如物體大小變化違背品質守恆之類的違規。作者通過眾包收集了 67,000 條人工標籤,用來評估 14 個前沿模型,隨後微調了一個 20 億參數的評審模型,它預測世界建模違規的準確率比 GPT-4o 高 8.6%(arXiv 2502.20694)。

Physics-IQ 涵蓋固體力學、流體力學、光學、熱力學和磁學。作者測試了 Sora、Runway、Pika、Lumiere、Stable Video Diffusion 和 VideoPoet,發現這些模型的物理理解非常有限,而且與畫面的逼真程度無關(arXiv 2501.09038)。

指標和參考協議請用這些基準。任何結果最終都要和它們對比。

人工判斷在哪裡起作用

VBench 用人工判斷來驗證它的各個維度,WorldModelBench 用人工判斷來訓練它的評審模型。評估自己的模型時,每出一個新檢查點,人工部分都要重做一遍。這時它就會遇到所有標註研究都有的問題:評分者知道哪個影片出自哪個模型,評分者對什麼算違規意見不一,也沒有一致性數字來證明這些標籤可信。

在 Potato 中評判生成的推演

rollout_evaluation 方案把兩段或更多推演放在同一個時鐘上顯示。標註者標出世界開始不合理的那一幀,標註是哪種物理或因果屬性被破壞了,按評分細則給出偏好,並判斷在給定干預下某個反事實分岔是否合理。面板可以隱藏模型身份,並按每位標註者固定的順序打亂,重新整理頁面也不會暴露哪個是哪個模型。

破綻點上的一致性分三方面報告:標註者是否發現了破綻、把它標在哪裡、給了什麼類別。匹配容差以多個取值的掃描來展示,而不是隻取一個閾值。

yaml
annotation_schemes:
  - annotation_type: rollout_evaluation
    name: rollout_review
    description: "Where does each rollout stop making sense?"
    streams:
      - {field: real,  name: "Recording", role: real}
      - {field: gen_a, name: "Model A"}
      - {field: gen_b, name: "Model B"}
    fps: 25
    layers: [violations, preference, counterfactual]
    blind: true
    shuffle: true
    require_clean: true

require_clean 把"沒有破綻"變成一個明確的答案,這樣就能區分沒人標記的推演和沒人看完的推演。見如何評估生成影片與世界模型

標註機器人回合

episode_annotation 方案把多路同步影片和機器人的時間序列通道(關節位置、夾爪狀態、力與力矩、獎勵)放在同一條時間軸上。標註者切分階段、標註每個階段的結果、繪製稠密的進度獎勵,並事後重寫指令。Potato 可以匯入 LeRobot v2、HDF5(RoboMimic 和 ALOHA)以及 RLDS/TFDS,並按幀寫出一個 JSONL 附屬檔案,因此不必改寫只讀的公開資料集。

一致性的報告方式是:階段邊界用時間 IoU,結果標籤用 α,獎勵曲線用 ICC 加 Pearson 相關,同時註明覆蓋率,因為只在時間軸 5% 上算出的相關,對其餘部分說明不了什麼。

維也納工業大學的 ATLAS 是一個用於長時程動作切分的桌面工具,能直接讀取 ROS bag 和 RLDS。對於由一名標註者精確放置邊界的工作,它是專門為此打造的。它發表的結果表明,在影片旁邊顯示本體感覺時間序列,比只看影片能減少邊界誤差;這正是 Potato 顯示這些通道的原因。RerunFoxglove 是最好的機器人視覺化工具,行為編碼方面 ELANBORIS 仍是標準。見如何標註機器人回合

視覺語言模型的定位與指點評估,見VLM 定位評估

Potato 在這方面不做的事

  • 沒有自動的物理評分器。 這部分請用基準自帶的評分器,Potato 用來收集檢驗它的人工標籤。
  • 不訓練模型,也不做推理。 Potato 顯示的是你生成的推演。
  • 不支援點雲序列。 3D 標註按幀進行。

以上內容於 2026 年 8 月和 9 月對照各項目的程式碼倉庫和論文核實。

常見問題

世界模型是如何評估的?

用 VBench、WorldModelBench、Physics-IQ 這類基準,從物理遵循、指令遵循和畫面品質方面給生成影片打分,再用人工判斷來驗證或訓練這些評分器。對一個新模型來說,人工部分就是讓人觀看推演,在不知道出自哪個模型的情況下,標出它們在物理上開始不合理的位置,並相互比較。

哪些世界模型基準使用了人工判斷?

VBench 為每個維度都收集了人工偏好標註,以表明它的自動分數與人一致。WorldModelBench 通過眾包在 14 個模型上收集了 67,000 條人工標籤,並用它們微調了一個自動評審模型。

標註機器人回合可以用什麼工具?

ATLAS 是供一名標註者從 ROS bag 或 RLDS 中切分長回合的桌面工具。Potato 讓多名標註者在瀏覽器中標註回合,能匯入 LeRobot v2、HDF5 和 RLDS/TFDS,並報告階段邊界、結果和獎勵曲線上的一致性。

如何衡量評判生成影片的人之間的一致性?

每段推演至少由兩名不知道它出自哪個模型的評分者評判。報告他們是否一致認為出現了破綻、在多個容差下破綻點有多接近,以及是否給出了相同的類別。Potato 的 rollout_evaluation 會分別報告這三項。

延伸閱讀