Skip to content

如何評估生成影片與世界模型

請標註者標出世界開始不成立的那一幀,而不是給合理性打分。斷點標註可核查、可定位,並且能產出真正的一致性統計量。

給一段生成影片的"物理合理性"打 5 分中的 3 分,得到的是一個無法核查、無法定位、也無法據以修復任何東西的數字。 改為詢問世界在哪一幀開始不成立,以及為什麼,得到的標註則三者兼備。

為什麼用斷點

一個時間點加一個類別,具備以下性質:

  • 可核查。 研究者可以開啟第 47 幀親眼看看。
  • 可定位。 這次失敗在張量中有確切位置,而不只是一個分數。
  • 可比較。 兩位標註者的答案是數軸上的兩個點,因此真正的機遇校正一致性統計量在此適用。

影片生成基準會報告 FVD 與勝率。它們沒有一個會報告產出這些勝率的人類之間是否彼此一致,這意味著它們都無法把模型差異與標註者噪聲區分開。

分類體系

請給標註者具名的類別,而不是讓他們自己描述失敗。一套可用的物理與因果類別:

類別含義
物體恆存性某個物體無緣無故地消失或出現
剛體違反固體物體發生彎曲、拉伸或尺寸變化
相互穿透兩個固體物體彼此穿過
重力違反有東西懸浮、向上墜落,或無支撐地立著
因果違反結果先於其原因發生,或沒有原因
身份跳變某個物體在幀與幀之間換了身份或類別
外觀漂移紋理、顏色或形狀在沒有事件解釋的情況下發生漂移

再加一個嚴重程度量表。"再看一遍才注意到"與"從這裡之後就沒什麼可判斷的了"是兩種不同的結論。

盲測必須是穩定的

按標註者打亂面板順序,使模型身份不可見,並把隨機種子固定為標註者與條目的函式,使其可復現。

每次檢視都重新隨機會破壞重複標註:標註者第二次檢視同一條目時,會因為與影片毫無關係的原因而與自己第一次的判斷不一致。

讓"沒有斷裂"成為明確答案

請要求一個肯定式的"這裡沒有問題"答案。沒有它,一段沒有任何標記的推演與一段根本沒被審閱過的推演無法區分,而你的分母會朝著美化模型的方向出錯。

報告掃描曲線

斷點一致性可拆解為三部分:

  • 檢測——他們究竟有沒有找到斷裂?
  • 定位——他們是否標在了同一位置?
  • 類別——他們是否給出了相同的名稱?

而定位取決於匹配容差。請報告跨容差的掃描曲線而非單一數字,因為 0.25 秒下與 2 秒下的一致性是兩種不同的斷言,只挑一個會讓讀者去假定那個支援自己結論的值。

配置

yaml
annotation_schemes:
  - annotation_type: rollout_evaluation
    name: rollout_review
    description: "Where does each rollout stop making sense?"
    streams:
      - {field: real,  name: "Recording", role: real}
      - {field: gen_a, name: "Model A"}
      - {field: gen_b, name: "Model B"}
    fps: 25
    layers: [violations, preference, counterfactual]
    blind: true
    shuffle: true
    require_clean: true

請顯式宣告 fps。缺少它時,輸出中會略去幀號,而不是去猜。

它的定位

VBench、WorldModelBench 與 Physics-IQ 提供指標與參考協議,眾包評審小組提供規模。它們都沒有提供的,是一件能夠反覆執行其中人工環節、並測量其信度的儀器——這正是本功能所填補的空缺;而把某個基準的推演結果匯入進來,是採集這些基準據以驗證的人工資料的一種合理做法。

延伸閱讀