如何評估生成影片與世界模型
請標註者標出世界開始不成立的那一幀,而不是給合理性打分。斷點標註可核查、可定位,並且能產出真正的一致性統計量。
給一段生成影片的"物理合理性"打 5 分中的 3 分,得到的是一個無法核查、無法定位、也無法據以修復任何東西的數字。 改為詢問世界在哪一幀開始不成立,以及為什麼,得到的標註則三者兼備。
為什麼用斷點
一個時間點加一個類別,具備以下性質:
- 可核查。 研究者可以開啟第 47 幀親眼看看。
- 可定位。 這次失敗在張量中有確切位置,而不只是一個分數。
- 可比較。 兩位標註者的答案是數軸上的兩個點,因此真正的機遇校正一致性統計量在此適用。
影片生成基準會報告 FVD 與勝率。它們沒有一個會報告產出這些勝率的人類之間是否彼此一致,這意味著它們都無法把模型差異與標註者噪聲區分開。
分類體系
請給標註者具名的類別,而不是讓他們自己描述失敗。一套可用的物理與因果類別:
| 類別 | 含義 |
|---|---|
| 物體恆存性 | 某個物體無緣無故地消失或出現 |
| 剛體違反 | 固體物體發生彎曲、拉伸或尺寸變化 |
| 相互穿透 | 兩個固體物體彼此穿過 |
| 重力違反 | 有東西懸浮、向上墜落,或無支撐地立著 |
| 因果違反 | 結果先於其原因發生,或沒有原因 |
| 身份跳變 | 某個物體在幀與幀之間換了身份或類別 |
| 外觀漂移 | 紋理、顏色或形狀在沒有事件解釋的情況下發生漂移 |
再加一個嚴重程度量表。"再看一遍才注意到"與"從這裡之後就沒什麼可判斷的了"是兩種不同的結論。
盲測必須是穩定的
按標註者打亂面板順序,使模型身份不可見,並把隨機種子固定為標註者與條目的函式,使其可復現。
每次檢視都重新隨機會破壞重複標註:標註者第二次檢視同一條目時,會因為與影片毫無關係的原因而與自己第一次的判斷不一致。
讓"沒有斷裂"成為明確答案
請要求一個肯定式的"這裡沒有問題"答案。沒有它,一段沒有任何標記的推演與一段根本沒被審閱過的推演無法區分,而你的分母會朝著美化模型的方向出錯。
報告掃描曲線
斷點一致性可拆解為三部分:
- 檢測——他們究竟有沒有找到斷裂?
- 定位——他們是否標在了同一位置?
- 類別——他們是否給出了相同的名稱?
而定位取決於匹配容差。請報告跨容差的掃描曲線而非單一數字,因為 0.25 秒下與 2 秒下的一致性是兩種不同的斷言,只挑一個會讓讀者去假定那個支援自己結論的值。
配置
annotation_schemes:
- annotation_type: rollout_evaluation
name: rollout_review
description: "Where does each rollout stop making sense?"
streams:
- {field: real, name: "Recording", role: real}
- {field: gen_a, name: "Model A"}
- {field: gen_b, name: "Model B"}
fps: 25
layers: [violations, preference, counterfactual]
blind: true
shuffle: true
require_clean: true請顯式宣告 fps。缺少它時,輸出中會略去幀號,而不是去猜。
它的定位
VBench、WorldModelBench 與 Physics-IQ 提供指標與參考協議,眾包評審小組提供規模。它們都沒有提供的,是一件能夠反覆執行其中人工環節、並測量其信度的儀器——這正是本功能所填補的空缺;而把某個基準的推演結果匯入進來,是採集這些基準據以驗證的人工資料的一種合理做法。