Skip to content

Herramientas de evaluación de modelos del mundo y episodios de robots comparadas

Los benchmarks, visualizadores y herramientas de anotación para evaluar vídeo generado, modelos del mundo y episodios de robots: VBench, WorldModelBench, Physics-IQ, ATLAS, Rerun y Potato.

Los modelos del mundo y los generadores de vídeo se evalúan con benchmarks como VBench, WorldModelBench y Physics-IQ, que definen qué medir y aportan evaluadores automáticos. Esos evaluadores se contrastan con juicios humanos. Recoger juicios humanos defendibles, con evaluadores que no saben qué modelo generó cada vídeo y con su acuerdo informado, es trabajo de anotación. Potato tiene esquemas para juzgar rollouts generados y para segmentar episodios de robots.

Un modelo del mundo predice cómo cambiará una escena, a menudo dada una acción, y un modelo de generación de vídeo puede evaluarse como tal preguntando si su salida obedece a la física y sigue la instrucción recibida. Un rollout es una continuación generada. Un episodio de robot es la grabación de un intento de realizar una tarea, normalmente varias cámaras más las posiciones de las articulaciones, el estado de la pinza y otras señales.

Esta página trata los modelos del mundo, el vídeo generado y la robótica. Herramientas de anotación con IA, comparadas cubre todos los tipos de datos en una sola página.

Qué hace cada herramienta

HerramientaQué esDónde intervienen las personas
VBenchConjunto de benchmarks para generación de vídeo, Apache-2.0Anotaciones de preferencia humana para cada dimensión, para comprobar que las puntuaciones automáticas coinciden con las personas
WorldModelBenchBenchmark de generadores de vídeo como modelos del mundo67.000 etiquetas humanas recogidas por crowdsourcing, usadas también para entrenar un juez automático
Physics-IQBenchmark de comprensión física en vídeo generativo, de Google DeepMindUna puntuación y una clasificación
ATLASHerramienta de escritorio para segmentar acciones de larga duración, compatible con ROS bags y RLDSUn anotador por episodio
Rerun, FoxgloveVisualización para robóticaVisualizar, no estudios de etiquetado
ELAN, BORISCodificación de conducta en vídeoELAN informa de la fiabilidad entre anotadores
CVAT, Label StudioAnotación de vídeo generalPistas y etiquetas de línea de tiempo, sin esquema para modelos del mundo
PotatoHerramienta de anotación con los esquemas rollout_evaluation y episode_annotationVarios anotadores por ítem, paneles a ciegas, acuerdo informado

Los benchmarks fijan el protocolo

VBench puntúa modelos de texto a vídeo en 16 dimensiones, entre ellas la coherencia del sujeto, la suavidad del movimiento y las relaciones espaciales. VBench-2.0 añade 18 dimensiones sobre sentido común, física, movimiento humano y composición. Para cada dimensión, los autores recogieron anotaciones de preferencia humana y mostraron que las puntuaciones automáticas las siguen.

WorldModelBench evalúa generadores de vídeo en seguimiento de instrucciones y adherencia a la física, y detecta violaciones como un objeto que cambia de tamaño en contra de la conservación de la masa. Los autores recogieron por crowdsourcing 67.000 etiquetas humanas para evaluar 14 modelos punteros y después ajustaron un juez de 2.000 millones de parámetros que predice violaciones del modelo del mundo con una exactitud un 8,6 % mayor que GPT-4o (arXiv 2502.20694).

Physics-IQ cubre mecánica de sólidos, dinámica de fluidos, óptica, termodinámica y magnetismo. Al probar Sora, Runway, Pika, Lumiere, Stable Video Diffusion y VideoPoet, sus autores concluyeron que la comprensión física es muy limitada y no guarda relación con el realismo visual (arXiv 2501.09038).

Úsalos para las métricas y los protocolos de referencia. Son aquello con lo que se comparará un resultado.

Dónde entra el juicio humano

VBench usa juicios humanos para validar sus dimensiones, y WorldModelBench para entrenar su juez. Cuando evalúas tu propio modelo, la parte humana hay que repetirla con cada nuevo checkpoint. Y entonces tiene los problemas de cualquier estudio de anotación: evaluadores que saben qué modelo hizo cada vídeo, evaluadores que discrepan sobre qué cuenta como violación, y ninguna cifra de acuerdo que muestre que las etiquetas son fiables.

Juzgar rollouts generados en Potato

El esquema rollout_evaluation muestra dos o más rollouts con un reloj compartido. Quien anota marca el fotograma en el que el mundo deja de tener sentido, indica qué propiedad física o causal se rompió, expresa una preferencia según una rúbrica y valora si una divergencia contrafactual es plausible dada la intervención. Los paneles pueden ocultar el modelo y barajarse en un orden estable para cada anotador, de modo que recargar la página no revela qué modelo es cuál.

El acuerdo sobre el punto de ruptura se informa de tres maneras: si los anotadores detectaron una ruptura, dónde la situaron y qué categoría le dieron. La tolerancia de emparejamiento se muestra como un barrido de valores y no en un único umbral.

yaml
annotation_schemes:
  - annotation_type: rollout_evaluation
    name: rollout_review
    description: "Where does each rollout stop making sense?"
    streams:
      - {field: real,  name: "Recording", role: real}
      - {field: gen_a, name: "Model A"}
      - {field: gen_b, name: "Model B"}
    fps: 25
    layers: [violations, preference, counterfactual]
    blind: true
    shuffle: true
    require_clean: true

require_clean convierte "sin ruptura" en una respuesta explícita, de modo que un rollout que nadie marcó se distingue de uno que nadie terminó de ver. Consulta Cómo evaluar vídeo generado y modelos del mundo.

Anotar episodios de robots

El esquema episode_annotation coloca varias cámaras sincronizadas y pistas de series temporales del robot (posiciones de las articulaciones, estado de la pinza, fuerza y par, recompensa) en una misma línea de tiempo. Los anotadores segmentan fases, marcan el resultado de cada fase, dibujan una recompensa de progreso densa y reformulan la instrucción a posteriori. Potato importa LeRobot v2, HDF5 (RoboMimic y ALOHA) y RLDS/TFDS, y escribe un archivo JSONL auxiliar por fotograma para no tener que reescribir un dataset público de solo lectura.

El acuerdo se informa como IoU temporal para los límites de fase, α para las etiquetas de resultado, e ICC con correlación de Pearson para las curvas de recompensa, indicando la cobertura, porque una correlación sobre el 5 % de una línea de tiempo no dice nada del resto.

ATLAS, de la TU Wien, es una herramienta de escritorio para segmentar acciones de larga duración que lee ROS bags y RLDS de forma nativa. Para un anotador que coloca límites con precisión, está hecha a medida. Su resultado publicado, que mostrar series temporales propioceptivas junto al vídeo reduce el error de límites frente a usar solo vídeo, es la razón por la que Potato dibuja esas pistas. Rerun y Foxglove son las mejores herramientas de visualización para robótica, y ELAN y BORIS siguen siendo el estándar para codificar conducta. Consulta Cómo anotar episodios de robots.

Para evaluar la localización y el señalamiento en modelos de visión y lenguaje, consulta Evaluación de la localización en VLM.

Lo que Potato no hace aquí

  • No tiene un evaluador automático de física. Usa para eso el evaluador de un benchmark, y Potato para las etiquetas humanas con las que se valida.
  • No entrena ni ejecuta modelos. Potato muestra los rollouts que tú generaste.
  • No tiene secuencias de nubes de puntos. La anotación 3D es por fotograma.

Comprobado en el repositorio y el artículo de cada proyecto en agosto y septiembre de 2026.

Preguntas frecuentes

¿Cómo se evalúan los modelos del mundo?

Con benchmarks que puntúan el vídeo generado por adherencia a la física, seguimiento de instrucciones y calidad visual, como VBench, WorldModelBench y Physics-IQ, y con juicios humanos que validan o entrenan esos evaluadores. Para un modelo nuevo, la parte humana consiste en personas que ven rollouts, marcan dónde dejan de tener sentido físico y los comparan, sin saber qué modelo los generó.

¿Qué benchmarks de modelos del mundo usan juicios humanos?

VBench recogió anotaciones de preferencia humana para cada una de sus dimensiones, para mostrar que sus puntuaciones automáticas coinciden con las personas. WorldModelBench recogió por crowdsourcing 67.000 etiquetas humanas sobre 14 modelos y las usó para ajustar un juez automático.

¿Qué herramienta puedo usar para anotar episodios de robots?

ATLAS es una herramienta de escritorio para que un anotador segmente episodios largos a partir de ROS bags o RLDS. Potato anota episodios en el navegador para varios anotadores, importa LeRobot v2, HDF5 y RLDS/TFDS, e informa del acuerdo sobre límites de fase, resultados y curvas de recompensa.

¿Cómo mido el acuerdo entre personas que juzgan vídeos generados?

Haz que al menos dos evaluadores juzguen cada rollout sin saber qué modelo lo produjo. Informa de si coinciden en que se rompe, de lo cerca que están sus puntos de ruptura en varias tolerancias y de si dan la misma categoría. rollout_evaluation de Potato informa de estas tres cosas por separado.

Lecturas adicionales