Skip to content

世界模型与机器人回合评估工具对比

评估生成视频、世界模型和机器人回合所用的基准、可视化工具和标注工具:VBench、WorldModelBench、Physics-IQ、ATLAS、Rerun 与 Potato。

世界模型和视频生成模型用 VBench、WorldModelBench、Physics-IQ 等基准来评估,这些基准规定了要测量什么,并提供自动评分器。这些自动评分器要用人工判断来检验。收集站得住脚的人工判断,也就是让评分者不知道视频出自哪个模型,并报告他们之间的一致性,这是标注工作。Potato 提供了评判生成的推演结果(rollout)和切分机器人回合的方案。

世界模型预测一个场景会如何变化,通常以某个动作为条件;视频生成模型也可以作为世界模型来评估,看它的输出是否遵循物理规律、是否执行了给定的指令。一次推演(rollout)是一段生成的后续画面。机器人回合是完成一项任务的一次尝试的记录,通常包括多路摄像头画面,以及关节位置、夹爪状态等信号。

本页讨论世界模型、生成视频和机器人。所有数据类型放在一页里的对比见 AI 标注工具对比

各工具的作用

工具是什么人在哪里参与
VBench视频生成基准套件,Apache-2.0每个维度都有人工偏好标注,用来检验自动分数是否与人一致
WorldModelBench把视频生成模型当作世界模型来评估的基准通过众包收集的 67,000 条人工标签,也用于训练一个自动评审
Physics-IQGoogle DeepMind 推出的生成视频物理理解基准一个分数和一个排行榜
ATLAS用于长时程动作切分的桌面工具,支持 ROS bag 和 RLDS每个回合一名标注者
RerunFoxglove机器人可视化用于查看,不用于标注研究
ELANBORIS视频中的行为编码ELAN 报告标注者间信度
CVATLabel Studio通用视频标注轨迹和时间轴标签,没有世界模型方案
Potato带有 rollout_evaluationepisode_annotation 方案的标注工具每个条目多名标注者、盲评面板、报告一致性

基准确定评估协议

VBench 在 16 个维度上给文本生成视频模型打分,包括主体一致性、运动平滑度和空间关系。VBench-2.0 又增加了 18 个维度,涉及常识、物理、人体运动和构图。作者为每个维度收集了人工偏好标注,并表明自动分数与之吻合。

WorldModelBench 从指令遵循和物理遵循两方面评估视频生成模型,能发现诸如物体大小变化违背质量守恒之类的违规。作者通过众包收集了 67,000 条人工标签,用来评估 14 个前沿模型,随后微调了一个 20 亿参数的评审模型,它预测世界建模违规的准确率比 GPT-4o 高 8.6%(arXiv 2502.20694)。

Physics-IQ 涵盖固体力学、流体力学、光学、热力学和磁学。作者测试了 Sora、Runway、Pika、Lumiere、Stable Video Diffusion 和 VideoPoet,发现这些模型的物理理解非常有限,而且与画面的逼真程度无关(arXiv 2501.09038)。

指标和参考协议请用这些基准。任何结果最终都要和它们对比。

人工判断在哪里起作用

VBench 用人工判断来验证它的各个维度,WorldModelBench 用人工判断来训练它的评审模型。评估自己的模型时,每出一个新检查点,人工部分都要重做一遍。这时它就会遇到所有标注研究都有的问题:评分者知道哪个视频出自哪个模型,评分者对什么算违规意见不一,也没有一致性数字来证明这些标签可信。

在 Potato 中评判生成的推演

rollout_evaluation 方案把两段或更多推演放在同一个时钟上显示。标注者标出世界开始不合理的那一帧,标注是哪种物理或因果属性被破坏了,按评分细则给出偏好,并判断在给定干预下某个反事实分岔是否合理。面板可以隐藏模型身份,并按每位标注者固定的顺序打乱,刷新页面也不会暴露哪个是哪个模型。

破绽点上的一致性分三方面报告:标注者是否发现了破绽、把它标在哪里、给了什么类别。匹配容差以多个取值的扫描来展示,而不是只取一个阈值。

yaml
annotation_schemes:
  - annotation_type: rollout_evaluation
    name: rollout_review
    description: "Where does each rollout stop making sense?"
    streams:
      - {field: real,  name: "Recording", role: real}
      - {field: gen_a, name: "Model A"}
      - {field: gen_b, name: "Model B"}
    fps: 25
    layers: [violations, preference, counterfactual]
    blind: true
    shuffle: true
    require_clean: true

require_clean 把"没有破绽"变成一个明确的答案,这样就能区分没人标记的推演和没人看完的推演。见如何评估生成视频与世界模型

标注机器人回合

episode_annotation 方案把多路同步视频和机器人的时间序列通道(关节位置、夹爪状态、力与力矩、奖励)放在同一条时间轴上。标注者切分阶段、标注每个阶段的结果、绘制稠密的进度奖励,并事后重写指令。Potato 可以导入 LeRobot v2、HDF5(RoboMimic 和 ALOHA)以及 RLDS/TFDS,并按帧写出一个 JSONL 附属文件,因此不必改写只读的公开数据集。

一致性的报告方式是:阶段边界用时间 IoU,结果标签用 α,奖励曲线用 ICC 加 Pearson 相关,同时注明覆盖率,因为只在时间轴 5% 上算出的相关,对其余部分说明不了什么。

维也纳工业大学的 ATLAS 是一个用于长时程动作切分的桌面工具,能直接读取 ROS bag 和 RLDS。对于由一名标注者精确放置边界的工作,它是专门为此打造的。它发表的结果表明,在视频旁边显示本体感觉时间序列,比只看视频能减少边界误差;这正是 Potato 显示这些通道的原因。RerunFoxglove 是最好的机器人可视化工具,行为编码方面 ELANBORIS 仍是标准。见如何标注机器人回合

视觉语言模型的定位与指点评估,见VLM 定位评估

Potato 在这方面不做的事

  • 没有自动的物理评分器。 这部分请用基准自带的评分器,Potato 用来收集检验它的人工标签。
  • 不训练模型,也不做推理。 Potato 显示的是你生成的推演。
  • 不支持点云序列。 3D 标注按帧进行。

以上内容于 2026 年 8 月和 9 月对照各项目的代码仓库和论文核实。

常见问题

世界模型是如何评估的?

用 VBench、WorldModelBench、Physics-IQ 这类基准,从物理遵循、指令遵循和画面质量方面给生成视频打分,再用人工判断来验证或训练这些评分器。对一个新模型来说,人工部分就是让人观看推演,在不知道出自哪个模型的情况下,标出它们在物理上开始不合理的位置,并相互比较。

哪些世界模型基准使用了人工判断?

VBench 为每个维度都收集了人工偏好标注,以表明它的自动分数与人一致。WorldModelBench 通过众包在 14 个模型上收集了 67,000 条人工标签,并用它们微调了一个自动评审模型。

标注机器人回合可以用什么工具?

ATLAS 是供一名标注者从 ROS bag 或 RLDS 中切分长回合的桌面工具。Potato 让多名标注者在浏览器中标注回合,能导入 LeRobot v2、HDF5 和 RLDS/TFDS,并报告阶段边界、结果和奖励曲线上的一致性。

如何衡量评判生成视频的人之间的一致性?

每段推演至少由两名不知道它出自哪个模型的评分者评判。报告他们是否一致认为出现了破绽、在多个容差下破绽点有多接近,以及是否给出了相同的类别。Potato 的 rollout_evaluation 会分别报告这三项。

延伸阅读