Skip to content

如何评估生成视频与世界模型

请标注者标出世界开始不成立的那一帧,而不是给合理性打分。断点标注可核查、可定位,并且能产出真正的一致性统计量。

给一段生成视频的"物理合理性"打 5 分中的 3 分,得到的是一个无法核查、无法定位、也无法据以修复任何东西的数字。 改为询问世界在哪一帧开始不成立,以及为什么,得到的标注则三者兼备。

为什么用断点

一个时间点加一个类别,具备以下性质:

  • 可核查。 研究者可以打开第 47 帧亲眼看看。
  • 可定位。 这次失败在张量中有确切位置,而不只是一个分数。
  • 可比较。 两位标注者的答案是数轴上的两个点,因此真正的机遇校正一致性统计量在此适用。

视频生成基准会报告 FVD 与胜率。它们没有一个会报告产出这些胜率的人类之间是否彼此一致,这意味着它们都无法把模型差异与标注者噪声区分开。

分类体系

请给标注者具名的类别,而不是让他们自己描述失败。一套可用的物理与因果类别:

类别含义
物体恒存性某个物体无缘无故地消失或出现
刚体违反固体物体发生弯曲、拉伸或尺寸变化
相互穿透两个固体物体彼此穿过
重力违反有东西悬浮、向上坠落,或无支撑地立着
因果违反结果先于其原因发生,或没有原因
身份跳变某个物体在帧与帧之间换了身份或类别
外观漂移纹理、颜色或形状在没有事件解释的情况下发生漂移

再加一个严重程度量表。"再看一遍才注意到"与"从这里之后就没什么可判断的了"是两种不同的结论。

盲测必须是稳定的

按标注者打乱面板顺序,使模型身份不可见,并把随机种子固定为标注者与条目的函数,使其可复现。

每次查看都重新随机会破坏重复标注:标注者第二次查看同一条目时,会因为与视频毫无关系的原因而与自己第一次的判断不一致。

让"没有断裂"成为明确答案

请要求一个肯定式的"这里没有问题"答案。没有它,一段没有任何标记的推演与一段根本没被审阅过的推演无法区分,而你的分母会朝着美化模型的方向出错。

报告扫描曲线

断点一致性可拆解为三部分:

  • 检测——他们究竟有没有找到断裂?
  • 定位——他们是否标在了同一位置?
  • 类别——他们是否给出了相同的名称?

而定位取决于匹配容差。请报告跨容差的扫描曲线而非单一数字,因为 0.25 秒下与 2 秒下的一致性是两种不同的断言,只挑一个会让读者去假定那个支持自己结论的值。

配置

yaml
annotation_schemes:
  - annotation_type: rollout_evaluation
    name: rollout_review
    description: "Where does each rollout stop making sense?"
    streams:
      - {field: real,  name: "Recording", role: real}
      - {field: gen_a, name: "Model A"}
      - {field: gen_b, name: "Model B"}
    fps: 25
    layers: [violations, preference, counterfactual]
    blind: true
    shuffle: true
    require_clean: true

请显式声明 fps。缺少它时,输出中会略去帧号,而不是去猜。

它的定位

VBench、WorldModelBench 与 Physics-IQ 提供指标与参考协议,众包评审小组提供规模。它们都没有提供的,是一件能够反复执行其中人工环节、并测量其信度的仪器——这正是本功能所填补的空缺;而把某个基准的推演结果导入进来,是采集这些基准据以验证的人工数据的一种合理做法。

延伸阅读