Ferramentas de avaliação de modelos de mundo e episódios de robôs comparadas
Os benchmarks, visualizadores e ferramentas de anotação usados para avaliar vídeo gerado, modelos de mundo e episódios de robôs: VBench, WorldModelBench, Physics-IQ, ATLAS, Rerun e Potato.
Os modelos de mundo e os geradores de vídeo avaliam-se com benchmarks como o VBench, o WorldModelBench e o Physics-IQ, que definem o que medir e fornecem avaliadores automáticos. Esses avaliadores são verificados face a juízos humanos. Recolher juízos humanos defensáveis, com avaliadores que não sabem que modelo gerou cada vídeo e com a concordância reportada, é trabalho de anotação. O Potato tem esquemas para avaliar rollouts gerados e para segmentar episódios de robôs.
Um modelo de mundo prevê como uma cena vai mudar, muitas vezes dada uma ação, e um modelo de geração de vídeo pode ser avaliado como tal perguntando se a sua saída obedece à física e segue a instrução que recebeu. Um rollout é uma continuação gerada. Um episódio de robô é a gravação de uma tentativa de realizar uma tarefa, normalmente várias câmaras mais as posições das articulações, o estado da garra e outros sinais.
Esta página trata de modelos de mundo, vídeo gerado e robótica. Ferramentas de anotação com IA, comparadas cobre todos os tipos de dados numa só página.
O que faz cada ferramenta
| Ferramenta | O que é | Onde entram as pessoas |
|---|---|---|
| VBench | Conjunto de benchmarks para geração de vídeo, Apache-2.0 | Anotações de preferência humana para cada dimensão, para verificar que as classificações automáticas coincidem com as pessoas |
| WorldModelBench | Benchmark de geradores de vídeo enquanto modelos de mundo | 67 000 rótulos humanos recolhidos por crowdsourcing, usados também para treinar um juiz automático |
| Physics-IQ | Benchmark de compreensão física em vídeo generativo, da Google DeepMind | Uma pontuação e uma tabela de classificação |
| ATLAS | Ferramenta de secretária para segmentação de ações de longa duração, com suporte para ROS bags e RLDS | Um anotador por episódio |
| Rerun, Foxglove | Visualização para robótica | Visualizar, não estudos de rotulagem |
| ELAN, BORIS | Codificação de comportamento em vídeo | O ELAN reporta a fiabilidade entre anotadores |
| CVAT, Label Studio | Anotação de vídeo geral | Trajetórias e rótulos na linha temporal, sem esquema para modelos de mundo |
| Potato | Ferramenta de anotação com os esquemas rollout_evaluation e episode_annotation | Vários anotadores por item, painéis às cegas, concordância reportada |
Os benchmarks definem o protocolo
O VBench classifica modelos de texto para vídeo em 16 dimensões, incluindo coerência do sujeito, suavidade do movimento e relações espaciais. O VBench-2.0 acrescenta 18 dimensões sobre senso comum, física, movimento humano e composição. Para cada dimensão, os autores recolheram anotações de preferência humana e mostraram que as classificações automáticas as acompanham.
O WorldModelBench avalia geradores de vídeo quanto ao seguimento de instruções e à aderência à física, e deteta violações como um objeto que muda de tamanho contra a conservação da massa. Os autores recolheram por crowdsourcing 67 000 rótulos humanos para avaliar 14 modelos de ponta e depois afinaram um juiz de 2 mil milhões de parâmetros que prevê violações do modelo de mundo com uma exatidão 8,6% superior à do GPT-4o (arXiv 2502.20694).
O Physics-IQ cobre mecânica de sólidos, dinâmica de fluidos, ótica, termodinâmica e magnetismo. Ao testar o Sora, o Runway, o Pika, o Lumiere, o Stable Video Diffusion e o VideoPoet, os autores concluíram que a compreensão física é muito limitada e não tem relação com o realismo visual (arXiv 2501.09038).
Use-os para as métricas e os protocolos de referência. É com eles que um resultado será comparado.
Onde entra o juízo humano
O VBench usa juízos humanos para validar as suas dimensões, e o WorldModelBench para treinar o seu juiz. Quando avalia o seu próprio modelo, a parte humana tem de ser repetida a cada novo checkpoint. E aí tem os problemas de qualquer estudo de anotação: avaliadores que sabem que modelo fez que vídeo, avaliadores que discordam sobre o que conta como violação, e nenhum valor de concordância que mostre que os rótulos são de confiança.
Avaliar rollouts gerados no Potato
O esquema rollout_evaluation mostra dois ou mais rollouts num relógio partilhado. Quem anota marca o fotograma em que o mundo deixa de fazer sentido, indica que propriedade física ou causal falhou, exprime uma preferência segundo uma rubrica e avalia se uma divergência contrafactual é plausível dada a intervenção. Os painéis podem esconder o modelo e ser baralhados numa ordem estável por anotador, para que recarregar a página não revele que modelo é qual.
A concordância sobre o ponto de rutura é reportada de três formas: se os anotadores detetaram uma rutura, onde a colocaram e que categoria lhe deram. A tolerância de correspondência aparece como uma varredura de valores e não num único limiar.
annotation_schemes:
- annotation_type: rollout_evaluation
name: rollout_review
description: "Where does each rollout stop making sense?"
streams:
- {field: real, name: "Recording", role: real}
- {field: gen_a, name: "Model A"}
- {field: gen_b, name: "Model B"}
fps: 25
layers: [violations, preference, counterfactual]
blind: true
shuffle: true
require_clean: truerequire_clean torna "sem rutura" uma resposta explícita, para distinguir um rollout que ninguém assinalou de um que ninguém acabou de ver. Veja Como avaliar vídeo gerado e modelos de mundo.
Anotar episódios de robôs
O esquema episode_annotation coloca vários fluxos de vídeo sincronizados e pistas de séries temporais do robô (posições das articulações, estado da garra, força-binário, recompensa) numa mesma linha temporal. Os anotadores segmentam fases, marcam o resultado de cada fase, desenham uma recompensa de progresso densa e reformulam a instrução a posteriori. O Potato importa LeRobot v2, HDF5 (RoboMimic e ALOHA) e RLDS/TFDS, e escreve um ficheiro JSONL auxiliar por fotograma, para que um dataset público só de leitura não tenha de ser reescrito.
A concordância é reportada como IoU temporal para os limites de fase, α para os rótulos de resultado, e ICC com correlação de Pearson para as curvas de recompensa, com a cobertura indicada, porque uma correlação calculada sobre 5% de uma linha temporal nada diz sobre o resto.
O ATLAS, da TU Wien, é uma ferramenta de secretária para segmentação de ações de longa duração que lê ROS bags e RLDS de forma nativa. Para um anotador que coloca limites com precisão, foi feito à medida. O seu resultado publicado, de que mostrar séries temporais proprioceptivas ao lado do vídeo reduz o erro nos limites face a usar só vídeo, é a razão pela qual o Potato desenha essas pistas. O Rerun e o Foxglove são as melhores ferramentas de visualização para robótica, e o ELAN e o BORIS continuam a ser a referência para codificação de comportamento. Veja Como anotar episódios de robôs.
Para avaliar a localização e o apontamento em modelos de visão e linguagem, veja Avaliação de grounding em VLM.
O que o Potato não faz aqui
- Sem avaliador automático de física. Para isso, use o avaliador de um benchmark, e o Potato para os rótulos humanos com que é validado.
- Sem treino nem inferência de modelos. O Potato mostra os rollouts que gerou.
- Sem sequências de nuvens de pontos. A anotação 3D é feita fotograma a fotograma.
Verificado no repositório e no artigo de cada projeto em agosto e setembro de 2026.
Perguntas frequentes
Como se avaliam modelos de mundo?
Com benchmarks que classificam o vídeo gerado quanto à aderência à física, ao seguimento de instruções e à qualidade visual, como o VBench, o WorldModelBench e o Physics-IQ, e com juízos humanos que validam ou treinam esses avaliadores. Para um modelo novo, a parte humana significa pessoas a ver rollouts, a marcar onde deixam de fazer sentido físico e a compará-los, sem saberem que modelo os produziu.
Que benchmarks de modelos de mundo usam juízos humanos?
O VBench recolheu anotações de preferência humana para cada uma das suas dimensões, para mostrar que as suas classificações automáticas coincidem com as pessoas. O WorldModelBench recolheu por crowdsourcing 67 000 rótulos humanos sobre 14 modelos e usou-os para afinar um juiz automático.
Que ferramenta posso usar para anotar episódios de robôs?
O ATLAS é uma ferramenta de secretária para um anotador segmentar episódios longos a partir de ROS bags ou RLDS. O Potato anota episódios no navegador para vários anotadores, importa LeRobot v2, HDF5 e RLDS/TFDS, e reporta a concordância sobre limites de fase, resultados e curvas de recompensa.
Como meço a concordância entre pessoas que avaliam vídeos gerados?
Faça com que cada rollout seja avaliado por pelo menos dois avaliadores que não saibam que modelo o produziu. Reporte se concordam que há rutura, quão próximos estão os seus pontos de rutura em várias tolerâncias e se atribuem a mesma categoria. O rollout_evaluation do Potato reporta estas três coisas em separado.
Leituras adicionais
- Ferramentas de anotação com IA, comparadas, todos os tipos de dados numa página
- Ferramentas de anotação de vídeo comparadas
- Ferramentas de anotação de imagens comparadas
- Ferramentas de avaliação de agentes de IA comparadas
- Ferramentas de anotação de texto comparadas
- Ferramentas de anotação de áudio comparadas
- Anotação de episódios de robôs