Skip to content

世界模型與生成式影片評估

把 2 到 N 段生成影片鎖幀對齊到同一時鐘上,請標註者標出世界開始不成立的那一幀,再標註是哪一條物理性質被破壞。

同一場景的若干段影片,鎖幀對齊在同一條時間軸上。標註者找出每一段推演開始不成立的那一幀,說明原因,選出優勝者;若該場景帶有干預設定,還要判斷這種分歧是否由該干預所致。 隨後 Potato 會報告標註者們對於斷裂發生在何處是否一致。

可執行示例:examples/agent-traces/world-model-rollouts/

斷點優於評分

給一段生成影片的"物理合理性"打 5 分中的 3 分,得到的是一個無法核查、無法定位、也無法據以修復任何東西的數字。

而"一個時間點加一個類別"三者都能做到:

  • 可核查。 研究者可以開啟第 47 幀親眼看看。
  • 可定位。 這次失敗在張量中有確切位置,而不只是一個分數。
  • 可比較。 兩位標註者的答案是數軸上的兩個點,因此真正的機遇校正一致性統計量在此適用。

影片生成基準會報告 FVD 與勝率。沒有一個會報告產出這些勝率的人類之間是否彼此一致,這意味著它們都無法把模型差異與標註者噪聲區分開。

配置

yaml
annotation_schemes:
  - annotation_type: rollout_evaluation
    name: rollout_review
    description: "Where does each rollout stop making sense?"
    streams:
      - {field: real,  name: "Recording", role: real}
      - {field: gen_a, name: "Model A"}
      - {field: gen_b, name: "Model B"}
    fps: 25
    layers: [violations, preference, counterfactual]
    blind: true
    shuffle: true
    require_clean: true
    violation_types:
      - {name: object_permanence, description: "An object vanishes, or appears, with nothing causing it."}
      - {name: interpenetration,  description: "Two solid objects pass through each other."}
      - {name: gravity_violation, description: "Something floats, falls upward, or stands unsupported."}

請顯式宣告 fps,否則輸出中會略去幀號,而不是去猜。

穩定的盲測與亂序

各面板可以按標註者進行盲測與亂序,並且亂序是穩定的,以標註者與條目為種子。同一位標註者第二次檢視同一條目時,順序與第一次一致;若每次都重新隨機,這一點就會被破壞。

require_clean: true 讓"沒有斷裂"成為一個明確的動作,而不是一個空答案。沒有它,一段沒有任何標記的推演與一段根本沒被審閱過的推演無法區分。

斷點一致性是一條掃描曲線

一致性以三種方式報告:檢測(他們是否找到了斷裂)、定位(是否標在了同一位置)、類別(是否給出了相同的名稱)。匹配容差以掃描曲線而非單一數字呈現。

這並不是為了細節而堆細節。0.25 秒下的一致性和 2 秒下的一致性是兩種不同的斷言,只報告一個閾值,等於允許讀者去挑選支援自己結論的那一個。

它在生態中的位置

與之可比的工作是各類基準——VBench、WorldModelBench、Physics-IQ——以及眾包評審小組。它們提供指標與參考協議;Potato 提供的是一件可以反覆執行此類協議中人工環節、並測量其信度的儀器。兩者互補,把某個基準的推演結果匯入 Potato,是採集這些基準據以驗證的人工資料的一種合理做法。

相關內容