Skip to content

Comparatif des outils d'évaluation des modèles du monde et des épisodes robotiques

Les benchmarks, visualiseurs et outils d'annotation pour évaluer la vidéo générée, les modèles du monde et les épisodes robotiques : VBench, WorldModelBench, Physics-IQ, ATLAS, Rerun et Potato.

Les modèles du monde et les générateurs de vidéo s'évaluent avec des benchmarks comme VBench, WorldModelBench et Physics-IQ, qui définissent ce qu'il faut mesurer et fournissent des évaluateurs automatiques. Ces évaluateurs sont vérifiés par rapport à des jugements humains. Recueillir des jugements humains défendables, avec des évaluateurs qui ignorent quel modèle a produit chaque vidéo et un accord rapporté, relève du travail d'annotation. Potato dispose de schémas pour juger des rollouts générés et pour segmenter des épisodes robotiques.

Un modèle du monde prédit comment une scène va évoluer, souvent en fonction d'une action, et un modèle de génération vidéo peut être évalué comme tel en vérifiant si sa sortie respecte la physique et suit l'instruction reçue. Un rollout est une continuation générée. Un épisode robotique est l'enregistrement d'une tentative de tâche, en général plusieurs flux de caméra plus les positions des articulations, l'état de la pince et d'autres signaux.

Cette page traite des modèles du monde, de la vidéo générée et de la robotique. Le comparatif des outils d'annotation par IA couvre tous les types de données sur une seule page.

Ce que fait chaque outil

OutilCe que c'estOù interviennent les humains
VBenchSuite de benchmarks pour la génération vidéo, Apache-2.0Des annotations de préférence humaine pour chaque dimension, pour vérifier que les scores automatiques concordent avec les humains
WorldModelBenchBenchmark des générateurs de vidéo en tant que modèles du monde67 000 étiquettes humaines recueillies par crowdsourcing, utilisées aussi pour entraîner un juge automatique
Physics-IQBenchmark de la compréhension physique dans la vidéo générative, de Google DeepMindUn score et un classement
ATLASOutil de bureau pour la segmentation d'actions de longue durée, compatible ROS bags et RLDSUn annotateur par épisode
Rerun, FoxgloveVisualisation pour la robotiqueVisualiser, pas mener des études d'étiquetage
ELAN, BORISCodage du comportement en vidéoELAN rapporte la fiabilité inter-annotateurs
CVAT, Label StudioAnnotation vidéo généralistePistes et étiquettes sur ligne de temps, sans schéma pour les modèles du monde
PotatoOutil d'annotation avec les schémas rollout_evaluation et episode_annotationPlusieurs annotateurs par élément, panels en aveugle, accord rapporté

Les benchmarks fixent le protocole

VBench note les modèles texte-vers-vidéo sur 16 dimensions, dont la cohérence du sujet, la fluidité du mouvement et les relations spatiales. VBench-2.0 ajoute 18 dimensions portant sur le sens commun, la physique, le mouvement humain et la composition. Pour chaque dimension, les auteurs ont recueilli des annotations de préférence humaine et montré que les scores automatiques les suivent.

WorldModelBench évalue les générateurs de vidéo sur le suivi des instructions et le respect de la physique, et détecte des violations comme un objet qui change de taille au mépris de la conservation de la masse. Les auteurs ont recueilli par crowdsourcing 67 000 étiquettes humaines pour évaluer 14 modèles de pointe, puis affiné un juge de 2 milliards de paramètres qui prédit les violations du modèle du monde avec une exactitude supérieure de 8,6 % à celle de GPT-4o (arXiv 2502.20694).

Physics-IQ couvre la mécanique des solides, la dynamique des fluides, l'optique, la thermodynamique et le magnétisme. En testant Sora, Runway, Pika, Lumiere, Stable Video Diffusion et VideoPoet, ses auteurs ont constaté une compréhension physique très limitée et sans lien avec le réalisme visuel (arXiv 2501.09038).

Servez-vous-en pour les métriques et les protocoles de référence. C'est à eux qu'un résultat sera comparé.

Où intervient le jugement humain

VBench utilise des jugements humains pour valider ses dimensions, et WorldModelBench pour entraîner son juge. Quand vous évaluez votre propre modèle, la partie humaine doit être refaite à chaque nouveau checkpoint. Elle a alors les problèmes de toute étude d'annotation : des évaluateurs qui savent quel modèle a produit quelle vidéo, des évaluateurs en désaccord sur ce qui compte comme violation, et aucun chiffre d'accord pour montrer que les étiquettes sont fiables.

Juger des rollouts générés dans Potato

Le schéma rollout_evaluation affiche deux rollouts ou plus sur une horloge commune. L'annotateur marque l'image à partir de laquelle le monde cesse d'avoir un sens, indique quelle propriété physique ou causale a été enfreinte, exprime une préférence selon une grille et évalue si une divergence contrefactuelle est plausible au vu de l'intervention. Les panels peuvent masquer le modèle et être mélangés dans un ordre stable propre à chaque annotateur, si bien qu'un rechargement ne révèle pas quel modèle est lequel.

L'accord sur le point de rupture est rapporté de trois façons : les annotateurs ont-ils détecté une rupture, où l'ont-ils placée, et quelle catégorie lui ont-ils donnée. La tolérance d'appariement est présentée comme un balayage de valeurs plutôt qu'à un seuil unique.

yaml
annotation_schemes:
  - annotation_type: rollout_evaluation
    name: rollout_review
    description: "Where does each rollout stop making sense?"
    streams:
      - {field: real,  name: "Recording", role: real}
      - {field: gen_a, name: "Model A"}
      - {field: gen_b, name: "Model B"}
    fps: 25
    layers: [violations, preference, counterfactual]
    blind: true
    shuffle: true
    require_clean: true

require_clean fait de « aucune rupture » une réponse explicite, pour distinguer un rollout que personne n'a signalé d'un rollout que personne n'a regardé jusqu'au bout. Voir Évaluer la vidéo générée et les modèles du monde.

Annoter des épisodes robotiques

Le schéma episode_annotation place plusieurs flux vidéo synchronisés et des pistes de séries temporelles du robot (positions des articulations, état de la pince, force-couple, récompense) sur une même ligne de temps. Les annotateurs segmentent les phases, marquent le résultat de chaque phase, tracent une récompense de progression dense et reformulent l'instruction a posteriori. Potato importe LeRobot v2, HDF5 (RoboMimic et ALOHA) et RLDS/TFDS, et écrit un fichier JSONL annexe par image, pour ne pas avoir à réécrire un jeu de données public en lecture seule.

L'accord est rapporté sous forme d'IoU temporelle pour les limites de phase, d'α pour les étiquettes de résultat, et d'ICC avec corrélation de Pearson pour les courbes de récompense, avec la couverture indiquée, car une corrélation calculée sur 5 % d'une ligne de temps ne dit rien du reste.

ATLAS, de la TU Wien, est un outil de bureau pour la segmentation d'actions de longue durée qui lit nativement les ROS bags et le RLDS. Pour un annotateur qui place des limites avec précision, il est conçu pour cela. Son résultat publié, selon lequel afficher les séries temporelles proprioceptives à côté de la vidéo réduit l'erreur sur les limites par rapport à la vidéo seule, explique pourquoi Potato trace ces pistes. Rerun et Foxglove sont les meilleurs outils de visualisation pour la robotique, et ELAN et BORIS restent les références pour le codage du comportement. Voir Annoter des épisodes robotiques.

Pour évaluer l'ancrage et le pointage des modèles vision-langage, voir Évaluer l'ancrage des VLM.

Ce que Potato ne fait pas ici

  • Pas d'évaluateur automatique de la physique. Utilisez pour cela l'évaluateur d'un benchmark, et Potato pour les étiquettes humaines qui servent à le valider.
  • Pas d'entraînement ni d'inférence de modèles. Potato affiche les rollouts que vous avez générés.
  • Pas de séquences de nuages de points. L'annotation 3D se fait image par image.

Vérifié dans le dépôt et l'article de chaque projet en août et septembre 2026.

Questions fréquentes

Comment évalue-t-on les modèles du monde ?

Avec des benchmarks qui notent la vidéo générée sur le respect de la physique, le suivi des instructions et la qualité visuelle, comme VBench, WorldModelBench et Physics-IQ, et avec des jugements humains qui valident ou entraînent ces évaluateurs. Pour un nouveau modèle, la partie humaine consiste à faire regarder des rollouts, marquer où ils cessent d'avoir un sens physique et les comparer, sans savoir quel modèle les a produits.

Quels benchmarks de modèles du monde utilisent des jugements humains ?

VBench a recueilli des annotations de préférence humaine pour chacune de ses dimensions afin de montrer que ses scores automatiques concordent avec les humains. WorldModelBench a recueilli par crowdsourcing 67 000 étiquettes humaines sur 14 modèles et s'en est servi pour affiner un juge automatique.

Quel outil utiliser pour annoter des épisodes robotiques ?

ATLAS est un outil de bureau pour un annotateur qui segmente de longs épisodes à partir de ROS bags ou de RLDS. Potato annote les épisodes dans le navigateur pour plusieurs annotateurs, importe LeRobot v2, HDF5 et RLDS/TFDS, et rapporte l'accord sur les limites de phase, les résultats et les courbes de récompense.

Comment mesurer l'accord entre des personnes qui jugent des vidéos générées ?

Faites juger chaque rollout par au moins deux évaluateurs qui ignorent quel modèle l'a produit. Rapportez s'ils s'accordent sur l'existence d'une rupture, à quel point leurs points de rupture sont proches selon plusieurs tolérances, et s'ils donnent la même catégorie. rollout_evaluation dans Potato rapporte ces trois éléments séparément.

Pour aller plus loin