Comparatif des outils d'évaluation des modèles du monde et des épisodes robotiques
Les benchmarks, visualiseurs et outils d'annotation pour évaluer la vidéo générée, les modèles du monde et les épisodes robotiques : VBench, WorldModelBench, Physics-IQ, ATLAS, Rerun et Potato.
Les modèles du monde et les générateurs de vidéo s'évaluent avec des benchmarks comme VBench, WorldModelBench et Physics-IQ, qui définissent ce qu'il faut mesurer et fournissent des évaluateurs automatiques. Ces évaluateurs sont vérifiés par rapport à des jugements humains. Recueillir des jugements humains défendables, avec des évaluateurs qui ignorent quel modèle a produit chaque vidéo et un accord rapporté, relève du travail d'annotation. Potato dispose de schémas pour juger des rollouts générés et pour segmenter des épisodes robotiques.
Un modèle du monde prédit comment une scène va évoluer, souvent en fonction d'une action, et un modèle de génération vidéo peut être évalué comme tel en vérifiant si sa sortie respecte la physique et suit l'instruction reçue. Un rollout est une continuation générée. Un épisode robotique est l'enregistrement d'une tentative de tâche, en général plusieurs flux de caméra plus les positions des articulations, l'état de la pince et d'autres signaux.
Cette page traite des modèles du monde, de la vidéo générée et de la robotique. Le comparatif des outils d'annotation par IA couvre tous les types de données sur une seule page.
Ce que fait chaque outil
| Outil | Ce que c'est | Où interviennent les humains |
|---|---|---|
| VBench | Suite de benchmarks pour la génération vidéo, Apache-2.0 | Des annotations de préférence humaine pour chaque dimension, pour vérifier que les scores automatiques concordent avec les humains |
| WorldModelBench | Benchmark des générateurs de vidéo en tant que modèles du monde | 67 000 étiquettes humaines recueillies par crowdsourcing, utilisées aussi pour entraîner un juge automatique |
| Physics-IQ | Benchmark de la compréhension physique dans la vidéo générative, de Google DeepMind | Un score et un classement |
| ATLAS | Outil de bureau pour la segmentation d'actions de longue durée, compatible ROS bags et RLDS | Un annotateur par épisode |
| Rerun, Foxglove | Visualisation pour la robotique | Visualiser, pas mener des études d'étiquetage |
| ELAN, BORIS | Codage du comportement en vidéo | ELAN rapporte la fiabilité inter-annotateurs |
| CVAT, Label Studio | Annotation vidéo généraliste | Pistes et étiquettes sur ligne de temps, sans schéma pour les modèles du monde |
| Potato | Outil d'annotation avec les schémas rollout_evaluation et episode_annotation | Plusieurs annotateurs par élément, panels en aveugle, accord rapporté |
Les benchmarks fixent le protocole
VBench note les modèles texte-vers-vidéo sur 16 dimensions, dont la cohérence du sujet, la fluidité du mouvement et les relations spatiales. VBench-2.0 ajoute 18 dimensions portant sur le sens commun, la physique, le mouvement humain et la composition. Pour chaque dimension, les auteurs ont recueilli des annotations de préférence humaine et montré que les scores automatiques les suivent.
WorldModelBench évalue les générateurs de vidéo sur le suivi des instructions et le respect de la physique, et détecte des violations comme un objet qui change de taille au mépris de la conservation de la masse. Les auteurs ont recueilli par crowdsourcing 67 000 étiquettes humaines pour évaluer 14 modèles de pointe, puis affiné un juge de 2 milliards de paramètres qui prédit les violations du modèle du monde avec une exactitude supérieure de 8,6 % à celle de GPT-4o (arXiv 2502.20694).
Physics-IQ couvre la mécanique des solides, la dynamique des fluides, l'optique, la thermodynamique et le magnétisme. En testant Sora, Runway, Pika, Lumiere, Stable Video Diffusion et VideoPoet, ses auteurs ont constaté une compréhension physique très limitée et sans lien avec le réalisme visuel (arXiv 2501.09038).
Servez-vous-en pour les métriques et les protocoles de référence. C'est à eux qu'un résultat sera comparé.
Où intervient le jugement humain
VBench utilise des jugements humains pour valider ses dimensions, et WorldModelBench pour entraîner son juge. Quand vous évaluez votre propre modèle, la partie humaine doit être refaite à chaque nouveau checkpoint. Elle a alors les problèmes de toute étude d'annotation : des évaluateurs qui savent quel modèle a produit quelle vidéo, des évaluateurs en désaccord sur ce qui compte comme violation, et aucun chiffre d'accord pour montrer que les étiquettes sont fiables.
Juger des rollouts générés dans Potato
Le schéma rollout_evaluation affiche deux rollouts ou plus sur une horloge commune. L'annotateur marque l'image à partir de laquelle le monde cesse d'avoir un sens, indique quelle propriété physique ou causale a été enfreinte, exprime une préférence selon une grille et évalue si une divergence contrefactuelle est plausible au vu de l'intervention. Les panels peuvent masquer le modèle et être mélangés dans un ordre stable propre à chaque annotateur, si bien qu'un rechargement ne révèle pas quel modèle est lequel.
L'accord sur le point de rupture est rapporté de trois façons : les annotateurs ont-ils détecté une rupture, où l'ont-ils placée, et quelle catégorie lui ont-ils donnée. La tolérance d'appariement est présentée comme un balayage de valeurs plutôt qu'à un seuil unique.
annotation_schemes:
- annotation_type: rollout_evaluation
name: rollout_review
description: "Where does each rollout stop making sense?"
streams:
- {field: real, name: "Recording", role: real}
- {field: gen_a, name: "Model A"}
- {field: gen_b, name: "Model B"}
fps: 25
layers: [violations, preference, counterfactual]
blind: true
shuffle: true
require_clean: truerequire_clean fait de « aucune rupture » une réponse explicite, pour distinguer un rollout que personne n'a signalé d'un rollout que personne n'a regardé jusqu'au bout. Voir Évaluer la vidéo générée et les modèles du monde.
Annoter des épisodes robotiques
Le schéma episode_annotation place plusieurs flux vidéo synchronisés et des pistes de séries temporelles du robot (positions des articulations, état de la pince, force-couple, récompense) sur une même ligne de temps. Les annotateurs segmentent les phases, marquent le résultat de chaque phase, tracent une récompense de progression dense et reformulent l'instruction a posteriori. Potato importe LeRobot v2, HDF5 (RoboMimic et ALOHA) et RLDS/TFDS, et écrit un fichier JSONL annexe par image, pour ne pas avoir à réécrire un jeu de données public en lecture seule.
L'accord est rapporté sous forme d'IoU temporelle pour les limites de phase, d'α pour les étiquettes de résultat, et d'ICC avec corrélation de Pearson pour les courbes de récompense, avec la couverture indiquée, car une corrélation calculée sur 5 % d'une ligne de temps ne dit rien du reste.
ATLAS, de la TU Wien, est un outil de bureau pour la segmentation d'actions de longue durée qui lit nativement les ROS bags et le RLDS. Pour un annotateur qui place des limites avec précision, il est conçu pour cela. Son résultat publié, selon lequel afficher les séries temporelles proprioceptives à côté de la vidéo réduit l'erreur sur les limites par rapport à la vidéo seule, explique pourquoi Potato trace ces pistes. Rerun et Foxglove sont les meilleurs outils de visualisation pour la robotique, et ELAN et BORIS restent les références pour le codage du comportement. Voir Annoter des épisodes robotiques.
Pour évaluer l'ancrage et le pointage des modèles vision-langage, voir Évaluer l'ancrage des VLM.
Ce que Potato ne fait pas ici
- Pas d'évaluateur automatique de la physique. Utilisez pour cela l'évaluateur d'un benchmark, et Potato pour les étiquettes humaines qui servent à le valider.
- Pas d'entraînement ni d'inférence de modèles. Potato affiche les rollouts que vous avez générés.
- Pas de séquences de nuages de points. L'annotation 3D se fait image par image.
Vérifié dans le dépôt et l'article de chaque projet en août et septembre 2026.
Questions fréquentes
Comment évalue-t-on les modèles du monde ?
Avec des benchmarks qui notent la vidéo générée sur le respect de la physique, le suivi des instructions et la qualité visuelle, comme VBench, WorldModelBench et Physics-IQ, et avec des jugements humains qui valident ou entraînent ces évaluateurs. Pour un nouveau modèle, la partie humaine consiste à faire regarder des rollouts, marquer où ils cessent d'avoir un sens physique et les comparer, sans savoir quel modèle les a produits.
Quels benchmarks de modèles du monde utilisent des jugements humains ?
VBench a recueilli des annotations de préférence humaine pour chacune de ses dimensions afin de montrer que ses scores automatiques concordent avec les humains. WorldModelBench a recueilli par crowdsourcing 67 000 étiquettes humaines sur 14 modèles et s'en est servi pour affiner un juge automatique.
Quel outil utiliser pour annoter des épisodes robotiques ?
ATLAS est un outil de bureau pour un annotateur qui segmente de longs épisodes à partir de ROS bags ou de RLDS. Potato annote les épisodes dans le navigateur pour plusieurs annotateurs, importe LeRobot v2, HDF5 et RLDS/TFDS, et rapporte l'accord sur les limites de phase, les résultats et les courbes de récompense.
Comment mesurer l'accord entre des personnes qui jugent des vidéos générées ?
Faites juger chaque rollout par au moins deux évaluateurs qui ignorent quel modèle l'a produit. Rapportez s'ils s'accordent sur l'existence d'une rupture, à quel point leurs points de rupture sont proches selon plusieurs tolérances, et s'ils donnent la même catégorie. rollout_evaluation dans Potato rapporte ces trois éléments séparément.
Pour aller plus loin
- Comparatif des outils d'annotation par IA, tous les types de données sur une page
- Comparatif des outils d'annotation vidéo
- Comparatif des outils d'annotation d'images
- Comparatif des outils d'évaluation d'agents IA
- Comparatif des outils d'annotation de texte
- Comparatif des outils d'annotation audio
- Annotation d'épisodes robotiques