如何评估生成视频与世界模型
请标注者标出世界开始不成立的那一帧,而不是给合理性打分。断点标注可核查、可定位,并且能产出真正的一致性统计量。
给一段生成视频的"物理合理性"打 5 分中的 3 分,得到的是一个无法核查、无法定位、也无法据以修复任何东西的数字。 改为询问世界在哪一帧开始不成立,以及为什么,得到的标注则三者兼备。
为什么用断点
一个时间点加一个类别,具备以下性质:
- 可核查。 研究者可以打开第 47 帧亲眼看看。
- 可定位。 这次失败在张量中有确切位置,而不只是一个分数。
- 可比较。 两位标注者的答案是数轴上的两个点,因此真正的机遇校正一致性统计量在此适用。
视频生成基准会报告 FVD 与胜率。它们没有一个会报告产出这些胜率的人类之间是否彼此一致,这意味着它们都无法把模型差异与标注者噪声区分开。
分类体系
请给标注者具名的类别,而不是让他们自己描述失败。一套可用的物理与因果类别:
| 类别 | 含义 |
|---|---|
| 物体恒存性 | 某个物体无缘无故地消失或出现 |
| 刚体违反 | 固体物体发生弯曲、拉伸或尺寸变化 |
| 相互穿透 | 两个固体物体彼此穿过 |
| 重力违反 | 有东西悬浮、向上坠落,或无支撑地立着 |
| 因果违反 | 结果先于其原因发生,或没有原因 |
| 身份跳变 | 某个物体在帧与帧之间换了身份或类别 |
| 外观漂移 | 纹理、颜色或形状在没有事件解释的情况下发生漂移 |
再加一个严重程度量表。"再看一遍才注意到"与"从这里之后就没什么可判断的了"是两种不同的结论。
盲测必须是稳定的
按标注者打乱面板顺序,使模型身份不可见,并把随机种子固定为标注者与条目的函数,使其可复现。
每次查看都重新随机会破坏重复标注:标注者第二次查看同一条目时,会因为与视频毫无关系的原因而与自己第一次的判断不一致。
让"没有断裂"成为明确答案
请要求一个肯定式的"这里没有问题"答案。没有它,一段没有任何标记的推演与一段根本没被审阅过的推演无法区分,而你的分母会朝着美化模型的方向出错。
报告扫描曲线
断点一致性可拆解为三部分:
- 检测——他们究竟有没有找到断裂?
- 定位——他们是否标在了同一位置?
- 类别——他们是否给出了相同的名称?
而定位取决于匹配容差。请报告跨容差的扫描曲线而非单一数字,因为 0.25 秒下与 2 秒下的一致性是两种不同的断言,只挑一个会让读者去假定那个支持自己结论的值。
配置
annotation_schemes:
- annotation_type: rollout_evaluation
name: rollout_review
description: "Where does each rollout stop making sense?"
streams:
- {field: real, name: "Recording", role: real}
- {field: gen_a, name: "Model A"}
- {field: gen_b, name: "Model B"}
fps: 25
layers: [violations, preference, counterfactual]
blind: true
shuffle: true
require_clean: true请显式声明 fps。缺少它时,输出中会略去帧号,而不是去猜。
它的定位
VBench、WorldModelBench 与 Physics-IQ 提供指标与参考协议,众包评审小组提供规模。它们都没有提供的,是一件能够反复执行其中人工环节、并测量其信度的仪器——这正是本功能所填补的空缺;而把某个基准的推演结果导入进来,是采集这些基准据以验证的人工数据的一种合理做法。