세계 모델과 생성 영상 평가
같은 시계에 프레임을 맞춘 2개에서 N개의 생성 영상을 보여주고, 세계가 말이 되지 않기 시작하는 프레임을 표시하게 한 뒤 어떤 물리적 성질이 깨졌는지 태그하게 합니다.
같은 시나리오의 영상 여러 편을 하나의 타임라인에 프레임 단위로 맞춰 놓습니다. 주석자는 각 롤아웃이 말이 되지 않기 시작하는 프레임을 찾아 이유를 말하고, 승자를 고르고, 시나리오에 개입이 들어 있으면 그 발산이 개입에서 따라 나오는지 판정합니다. 그런 다음 Potato는 주석자들이 붕괴의 위치에 대해 일치했는지를 보고합니다.
동작하는 예시: examples/agent-traces/world-model-rollouts/.
붕괴 지점이 점수보다 낫다
생성된 영상에 "물리적 그럴듯함" 5점 만점에 3점을 매기면, 검증할 수도 없고 위치를 짚을 수도 없으며 무언가를 고치는 데 쓸 수도 없는 수치가 나옵니다.
시점과 범주의 조합은 그 셋을 모두 해냅니다.
- 검증할 수 있습니다. 연구자가 47번 프레임을 열어 볼 수 있습니다.
- 위치를 짚을 수 있습니다. 실패가 점수뿐 아니라 텐서 위의 자리를 갖습니다.
- 비교할 수 있습니다. 두 주석자의 답은 직선 위의 두 점이므로, 진짜 우연 일치 보정 통계를 적용할 수 있습니다.
영상 생성 벤치마크는 FVD와 승률을 보고합니다. 그러나 그 승률을 만들어 낸 사람들이 서로 일치했는지를 보고하는 것은 하나도 없으며, 따라서 어느 것도 모델 간 차이와 주석자 잡음을 갈라내지 못합니다.
설정
annotation_schemes:
- annotation_type: rollout_evaluation
name: rollout_review
description: "Where does each rollout stop making sense?"
streams:
- {field: real, name: "Recording", role: real}
- {field: gen_a, name: "Model A"}
- {field: gen_b, name: "Model B"}
fps: 25
layers: [violations, preference, counterfactual]
blind: true
shuffle: true
require_clean: true
violation_types:
- {name: object_permanence, description: "An object vanishes, or appears, with nothing causing it."}
- {name: interpenetration, description: "Two solid objects pass through each other."}
- {name: gravity_violation, description: "Something floats, falls upward, or stands unsupported."}fps를 명시하십시오. 지정하지 않으면 프레임 번호는 추측되는 대신 출력에서 생략됩니다.
눈가림과 섞기는 안정적이다
패널은 주석자별로 눈가림하고 섞을 수 있으며, 그 섞기는 주석자와 항목에 시드가 고정되어 있어 안정적입니다. 같은 항목에 대한 주석자의 두 번째 판단이 첫 번째와 어긋나지 않는데, 볼 때마다 새로 무작위화하면 그것이 깨집니다.
require_clean: true는 "붕괴 없음"을 빈 답이 아니라 명시적인 행위로 만듭니다. 이것이 없으면 표시가 없는 롤아웃은 아예 검토되지 않은 롤아웃과 구분되지 않습니다.
붕괴 지점 일치도는 스윕이다
일치도는 세 갈래로 보고됩니다. 검출(애초에 붕괴를 찾아냈는가), 위치 지정(같은 자리에 놓았는가), 범주(같은 이름으로 불렀는가)입니다. 매칭 허용 오차는 수치 하나가 아니라 스윕으로 제시됩니다.
이는 상세함을 위한 상세함이 아닙니다. 0.25초에서의 일치도와 2초에서의 일치도는 서로 다른 주장이며, 임계값 하나만 보고하면 읽는 사람이 자기 결론을 뒷받침하는 쪽을 마음대로 가정하게 됩니다.
이 방법이 생태계에서 놓이는 자리
비교 대상은 벤치마크 — VBench, WorldModelBench, Physics-IQ — 와 크라우드 패널입니다. 그쪽이 지표와 참조 프로토콜을 제공하고, Potato는 그런 프로토콜의 사람 쪽을 신뢰도를 측정하면서 반복적으로 돌릴 도구를 제공합니다. 둘은 서로를 보완하며, 벤치마크의 롤아웃을 Potato로 들여오는 것은 그 벤치마크들이 검증 근거로 삼는 사람 데이터를 모으는 합리적인 방법입니다.