세계 모델과 로봇 에피소드 평가 도구 비교
생성 영상, 세계 모델, 로봇 에피소드 평가에 쓰이는 벤치마크, 시각화 도구, 어노테이션 도구를 정리합니다. VBench, WorldModelBench, Physics-IQ, ATLAS, Rerun, Potato.
세계 모델과 영상 생성 모델은 VBench, WorldModelBench, Physics-IQ 같은 벤치마크로 평가합니다. 이 벤치마크들은 무엇을 측정할지 정하고 자동 평가기를 제공합니다. 그리고 그 자동 평가기는 사람의 판단과 대조해 검증됩니다. 평가자가 어떤 모델의 결과인지 모르게 하고 평가자 간 일치도까지 보고하는, 근거로 내세울 수 있는 사람의 판단을 모으는 일은 어노테이션 작업입니다. Potato에는 생성된 롤아웃을 판정하는 스키마와 로봇 에피소드를 구간으로 나누는 스키마가 있습니다.
세계 모델은 흔히 어떤 행동을 조건으로 장면이 어떻게 바뀔지 예측합니다. 영상 생성 모델도 출력이 물리 법칙을 따르는지, 주어진 지시를 따르는지 물어봄으로써 세계 모델로 평가할 수 있습니다. 롤아웃은 생성된 이어지는 장면 하나를 말합니다. 로봇 에피소드는 과제를 한 번 시도한 기록으로, 보통 여러 카메라 영상과 관절 위치, 그리퍼 상태 같은 신호를 포함합니다.
이 페이지는 세계 모델, 생성 영상, 로보틱스를 다룹니다. 모든 데이터 유형을 한 페이지에서 비교한 내용은 AI 주석 도구 비교에 있습니다.
각 도구가 하는 일
| 도구 | 설명 | 사람이 개입하는 부분 |
|---|---|---|
| VBench | 영상 생성 벤치마크 모음, Apache-2.0 | 자동 점수가 사람과 일치하는지 확인하기 위한 차원별 사람 선호 어노테이션 |
| WorldModelBench | 영상 생성 모델을 세계 모델로 평가하는 벤치마크 | 크라우드소싱으로 모은 사람 레이블 67,000개. 자동 심판 학습에도 사용됨 |
| Physics-IQ | 생성 영상의 물리 이해를 측정하는 Google DeepMind의 벤치마크 | 점수와 리더보드 |
| ATLAS | ROS bag과 RLDS를 지원하는, 긴 행동 구간 분할용 데스크톱 도구 | 에피소드마다 어노테이터 한 명 |
| Rerun, Foxglove | 로보틱스 시각화 | 보기 위한 도구이며 레이블링 연구용은 아님 |
| ELAN, BORIS | 비디오 행동 코딩 | ELAN은 어노테이터 간 신뢰도를 보고함 |
| CVAT, Label Studio | 범용 비디오 어노테이션 | 트랙과 타임라인 레이블. 세계 모델용 스키마는 없음 |
| Potato | rollout_evaluation과 episode_annotation 스키마를 갖춘 어노테이션 도구 | 항목당 여러 어노테이터, 블라인드 패널, 일치도 보고 |
벤치마크가 프로토콜을 정한다
VBench는 텍스트-영상 모델을 16개 차원으로 채점합니다. 피사체 일관성, 움직임의 매끄러움, 공간 관계 등이 포함됩니다. VBench-2.0은 상식, 물리, 사람의 움직임, 구성에 관한 18개 차원을 더합니다. 저자들은 차원마다 사람의 선호 어노테이션을 모았고, 자동 점수가 이를 따른다는 것을 보였습니다.
WorldModelBench는 영상 생성 모델을 지시 준수와 물리 준수로 평가하며, 질량 보존에 어긋나게 물체의 크기가 바뀌는 것 같은 위반을 잡아냅니다. 저자들은 크라우드소싱으로 사람 레이블 67,000개를 모아 최신 모델 14개를 평가한 뒤, 20억 파라미터 심판을 파인튜닝했습니다. 이 심판은 세계 모델링 위반을 GPT-4o보다 8.6% 높은 정확도로 예측합니다(arXiv 2502.20694).
Physics-IQ는 고체 역학, 유체 역학, 광학, 열역학, 자기를 다룹니다. 저자들은 Sora, Runway, Pika, Lumiere, Stable Video Diffusion, VideoPoet을 시험한 결과, 물리 이해가 매우 제한적이며 시각적 사실감과 관계가 없다는 것을 확인했습니다(arXiv 2501.09038).
지표와 기준 프로토콜에는 이 벤치마크들을 쓰세요. 결과는 이것들과 비교됩니다.
사람의 판단이 들어오는 곳
VBench는 차원을 검증하는 데, WorldModelBench는 심판을 학습시키는 데 사람의 판단을 씁니다. 자신의 모델을 평가할 때는 새 체크포인트가 나올 때마다 사람이 하는 부분을 다시 해야 합니다. 그러면 모든 어노테이션 연구가 겪는 문제가 생깁니다. 평가자가 어떤 영상이 어떤 모델의 것인지 알고 있다는 점, 무엇을 위반으로 볼지를 두고 평가자끼리 의견이 갈린다는 점, 그리고 레이블을 믿을 수 있음을 보여 줄 일치도 수치가 없다는 점입니다.
Potato에서 생성 롤아웃 판정하기
rollout_evaluation 스키마는 두 개 이상의 롤아웃을 공통 시계에 맞춰 보여 줍니다. 어노테이터는 세계가 말이 안 되기 시작하는 프레임을 표시하고, 어떤 물리적·인과적 성질이 깨졌는지 태그하고, 루브릭에 따라 선호를 밝히고, 개입을 고려할 때 반사실적 분기가 그럴듯한지 평가합니다. 패널은 모델을 가리고 어노테이터마다 고정된 순서로 섞을 수 있어서, 페이지를 새로 고쳐도 어떤 모델인지 드러나지 않습니다.
붕괴 지점의 일치도는 세 가지로 보고합니다. 어노테이터가 붕괴를 감지했는지, 어디에 두었는지, 어떤 범주를 붙였는지입니다. 매칭 허용 오차는 하나의 임계값이 아니라 여러 값에 걸친 스윕으로 보여 줍니다.
annotation_schemes:
- annotation_type: rollout_evaluation
name: rollout_review
description: "Where does each rollout stop making sense?"
streams:
- {field: real, name: "Recording", role: real}
- {field: gen_a, name: "Model A"}
- {field: gen_b, name: "Model B"}
fps: 25
layers: [violations, preference, counterfactual]
blind: true
shuffle: true
require_clean: truerequire_clean은 "붕괴 없음"을 명시적인 답으로 만들어, 아무도 표시하지 않은 롤아웃과 아무도 끝까지 보지 않은 롤아웃을 구분할 수 있게 합니다. 생성 영상과 세계 모델을 평가하는 방법을 참고하세요.
로봇 에피소드 어노테이션
episode_annotation 스키마는 동기화된 여러 영상 스트림과 로봇의 시계열 레인(관절 위치, 그리퍼 상태, 힘·토크, 보상)을 하나의 타임라인에 올립니다. 어노테이터는 단계를 나누고, 단계별 결과를 표시하고, 조밀한 진행 보상을 그리고, 사후에 지시문을 다시 붙입니다. Potato는 LeRobot v2, HDF5(RoboMimic과 ALOHA), RLDS/TFDS를 가져오고, 프레임별 JSONL 사이드카를 기록하므로 읽기 전용 공개 데이터셋을 다시 쓸 필요가 없습니다.
일치도는 단계 경계에 대한 시간 IoU, 결과 레이블에 대한 α, 보상 곡선에 대한 ICC와 Pearson 상관으로 보고하며, 커버리지를 함께 밝힙니다. 타임라인의 5%에서만 계산한 상관은 나머지에 대해 아무것도 말해 주지 않기 때문입니다.
TU Wien의 ATLAS는 ROS bag과 RLDS를 그대로 읽는, 긴 행동 구간 분할용 데스크톱 도구입니다. 한 명의 어노테이터가 경계를 정밀하게 두는 작업을 위해 만들어졌습니다. 영상 옆에 고유수용감각 시계열을 보여 주면 영상만 볼 때보다 경계 오차가 줄어든다는 ATLAS의 발표 결과가, Potato가 이 레인들을 그리는 이유입니다. Rerun과 Foxglove는 최고의 로보틱스 시각화 도구이고, 행동 코딩에서는 여전히 ELAN과 BORIS가 표준입니다. 로봇 에피소드에 주석을 다는 방법을 참고하세요.
시각-언어 모델의 그라운딩과 포인팅 평가는 VLM 그라운딩 평가를 참고하세요.
이 분야에서 Potato가 하지 않는 것
- 자동 물리 평가기가 없습니다. 그 용도로는 벤치마크의 평가기를 쓰고, 그 평가기를 검증할 사람 레이블에는 Potato를 쓰세요.
- 모델 학습이나 추론을 하지 않습니다. Potato는 여러분이 생성한 롤아웃을 보여 줍니다.
- 포인트 클라우드 시퀀스를 지원하지 않습니다. 3D 어노테이션은 프레임 단위입니다.
2026년 8월과 9월에 각 프로젝트의 저장소와 논문에서 확인했습니다.
자주 묻는 질문
세계 모델은 어떻게 평가하나요?
VBench, WorldModelBench, Physics-IQ처럼 생성 영상을 물리 준수, 지시 준수, 시각 품질로 채점하는 벤치마크와, 그 평가기를 검증하거나 학습시키는 사람의 판단으로 평가합니다. 새 모델이라면 사람이 하는 부분은, 어떤 모델의 결과인지 모르는 상태에서 롤아웃을 보고, 물리적으로 말이 안 되기 시작하는 지점을 표시하고, 서로 비교하는 일입니다.
사람의 판단을 쓰는 세계 모델 벤치마크는?
VBench는 자동 점수가 사람과 일치함을 보이기 위해 모든 차원에 대해 사람의 선호 어노테이션을 모았습니다. WorldModelBench는 14개 모델에 대해 크라우드소싱으로 사람 레이블 67,000개를 모았고, 이를 자동 심판 파인튜닝에 썼습니다.
로봇 에피소드 어노테이션에는 어떤 도구를 쓸 수 있나요?
ATLAS는 어노테이터 한 명이 ROS bag이나 RLDS의 긴 에피소드를 구간으로 나누는 데스크톱 도구입니다. Potato는 여러 어노테이터가 브라우저에서 에피소드를 어노테이션할 수 있게 하고, LeRobot v2, HDF5, RLDS/TFDS를 가져오며, 단계 경계, 결과, 보상 곡선의 일치도를 보고합니다.
생성 영상을 판정하는 사람들 사이의 일치도는 어떻게 측정하나요?
각 롤아웃을 어떤 모델이 만들었는지 모르는 평가자 두 명 이상에게 판정하게 하세요. 붕괴가 있다는 데 동의하는지, 여러 허용 오차에서 붕괴 지점이 얼마나 가까운지, 같은 범주를 붙이는지를 보고합니다. Potato의 rollout_evaluation은 이 세 가지를 따로 보고합니다.
더 읽어보기
- AI 주석 도구 비교, 모든 데이터 유형을 한 페이지에서
- 비디오 어노테이션 도구 비교
- 이미지 어노테이션 도구 비교
- AI 에이전트 평가 도구 비교
- 텍스트 어노테이션 도구 비교
- 오디오 어노테이션 도구 비교
- 로봇 에피소드 주석