Skip to content

Ferramentas de avaliação de modelos de mundo e episódios de robôs comparadas

Os benchmarks, visualizadores e ferramentas de anotação usados para avaliar vídeo gerado, modelos de mundo e episódios de robôs: VBench, WorldModelBench, Physics-IQ, ATLAS, Rerun e Potato.

Os modelos de mundo e os geradores de vídeo avaliam-se com benchmarks como o VBench, o WorldModelBench e o Physics-IQ, que definem o que medir e fornecem avaliadores automáticos. Esses avaliadores são verificados face a juízos humanos. Recolher juízos humanos defensáveis, com avaliadores que não sabem que modelo gerou cada vídeo e com a concordância reportada, é trabalho de anotação. O Potato tem esquemas para avaliar rollouts gerados e para segmentar episódios de robôs.

Um modelo de mundo prevê como uma cena vai mudar, muitas vezes dada uma ação, e um modelo de geração de vídeo pode ser avaliado como tal perguntando se a sua saída obedece à física e segue a instrução que recebeu. Um rollout é uma continuação gerada. Um episódio de robô é a gravação de uma tentativa de realizar uma tarefa, normalmente várias câmaras mais as posições das articulações, o estado da garra e outros sinais.

Esta página trata de modelos de mundo, vídeo gerado e robótica. Ferramentas de anotação com IA, comparadas cobre todos os tipos de dados numa só página.

O que faz cada ferramenta

FerramentaO que éOnde entram as pessoas
VBenchConjunto de benchmarks para geração de vídeo, Apache-2.0Anotações de preferência humana para cada dimensão, para verificar que as classificações automáticas coincidem com as pessoas
WorldModelBenchBenchmark de geradores de vídeo enquanto modelos de mundo67 000 rótulos humanos recolhidos por crowdsourcing, usados também para treinar um juiz automático
Physics-IQBenchmark de compreensão física em vídeo generativo, da Google DeepMindUma pontuação e uma tabela de classificação
ATLASFerramenta de secretária para segmentação de ações de longa duração, com suporte para ROS bags e RLDSUm anotador por episódio
Rerun, FoxgloveVisualização para robóticaVisualizar, não estudos de rotulagem
ELAN, BORISCodificação de comportamento em vídeoO ELAN reporta a fiabilidade entre anotadores
CVAT, Label StudioAnotação de vídeo geralTrajetórias e rótulos na linha temporal, sem esquema para modelos de mundo
PotatoFerramenta de anotação com os esquemas rollout_evaluation e episode_annotationVários anotadores por item, painéis às cegas, concordância reportada

Os benchmarks definem o protocolo

O VBench classifica modelos de texto para vídeo em 16 dimensões, incluindo coerência do sujeito, suavidade do movimento e relações espaciais. O VBench-2.0 acrescenta 18 dimensões sobre senso comum, física, movimento humano e composição. Para cada dimensão, os autores recolheram anotações de preferência humana e mostraram que as classificações automáticas as acompanham.

O WorldModelBench avalia geradores de vídeo quanto ao seguimento de instruções e à aderência à física, e deteta violações como um objeto que muda de tamanho contra a conservação da massa. Os autores recolheram por crowdsourcing 67 000 rótulos humanos para avaliar 14 modelos de ponta e depois afinaram um juiz de 2 mil milhões de parâmetros que prevê violações do modelo de mundo com uma exatidão 8,6% superior à do GPT-4o (arXiv 2502.20694).

O Physics-IQ cobre mecânica de sólidos, dinâmica de fluidos, ótica, termodinâmica e magnetismo. Ao testar o Sora, o Runway, o Pika, o Lumiere, o Stable Video Diffusion e o VideoPoet, os autores concluíram que a compreensão física é muito limitada e não tem relação com o realismo visual (arXiv 2501.09038).

Use-os para as métricas e os protocolos de referência. É com eles que um resultado será comparado.

Onde entra o juízo humano

O VBench usa juízos humanos para validar as suas dimensões, e o WorldModelBench para treinar o seu juiz. Quando avalia o seu próprio modelo, a parte humana tem de ser repetida a cada novo checkpoint. E aí tem os problemas de qualquer estudo de anotação: avaliadores que sabem que modelo fez que vídeo, avaliadores que discordam sobre o que conta como violação, e nenhum valor de concordância que mostre que os rótulos são de confiança.

Avaliar rollouts gerados no Potato

O esquema rollout_evaluation mostra dois ou mais rollouts num relógio partilhado. Quem anota marca o fotograma em que o mundo deixa de fazer sentido, indica que propriedade física ou causal falhou, exprime uma preferência segundo uma rubrica e avalia se uma divergência contrafactual é plausível dada a intervenção. Os painéis podem esconder o modelo e ser baralhados numa ordem estável por anotador, para que recarregar a página não revele que modelo é qual.

A concordância sobre o ponto de rutura é reportada de três formas: se os anotadores detetaram uma rutura, onde a colocaram e que categoria lhe deram. A tolerância de correspondência aparece como uma varredura de valores e não num único limiar.

yaml
annotation_schemes:
  - annotation_type: rollout_evaluation
    name: rollout_review
    description: "Where does each rollout stop making sense?"
    streams:
      - {field: real,  name: "Recording", role: real}
      - {field: gen_a, name: "Model A"}
      - {field: gen_b, name: "Model B"}
    fps: 25
    layers: [violations, preference, counterfactual]
    blind: true
    shuffle: true
    require_clean: true

require_clean torna "sem rutura" uma resposta explícita, para distinguir um rollout que ninguém assinalou de um que ninguém acabou de ver. Veja Como avaliar vídeo gerado e modelos de mundo.

Anotar episódios de robôs

O esquema episode_annotation coloca vários fluxos de vídeo sincronizados e pistas de séries temporais do robô (posições das articulações, estado da garra, força-binário, recompensa) numa mesma linha temporal. Os anotadores segmentam fases, marcam o resultado de cada fase, desenham uma recompensa de progresso densa e reformulam a instrução a posteriori. O Potato importa LeRobot v2, HDF5 (RoboMimic e ALOHA) e RLDS/TFDS, e escreve um ficheiro JSONL auxiliar por fotograma, para que um dataset público só de leitura não tenha de ser reescrito.

A concordância é reportada como IoU temporal para os limites de fase, α para os rótulos de resultado, e ICC com correlação de Pearson para as curvas de recompensa, com a cobertura indicada, porque uma correlação calculada sobre 5% de uma linha temporal nada diz sobre o resto.

O ATLAS, da TU Wien, é uma ferramenta de secretária para segmentação de ações de longa duração que lê ROS bags e RLDS de forma nativa. Para um anotador que coloca limites com precisão, foi feito à medida. O seu resultado publicado, de que mostrar séries temporais proprioceptivas ao lado do vídeo reduz o erro nos limites face a usar só vídeo, é a razão pela qual o Potato desenha essas pistas. O Rerun e o Foxglove são as melhores ferramentas de visualização para robótica, e o ELAN e o BORIS continuam a ser a referência para codificação de comportamento. Veja Como anotar episódios de robôs.

Para avaliar a localização e o apontamento em modelos de visão e linguagem, veja Avaliação de grounding em VLM.

O que o Potato não faz aqui

  • Sem avaliador automático de física. Para isso, use o avaliador de um benchmark, e o Potato para os rótulos humanos com que é validado.
  • Sem treino nem inferência de modelos. O Potato mostra os rollouts que gerou.
  • Sem sequências de nuvens de pontos. A anotação 3D é feita fotograma a fotograma.

Verificado no repositório e no artigo de cada projeto em agosto e setembro de 2026.

Perguntas frequentes

Como se avaliam modelos de mundo?

Com benchmarks que classificam o vídeo gerado quanto à aderência à física, ao seguimento de instruções e à qualidade visual, como o VBench, o WorldModelBench e o Physics-IQ, e com juízos humanos que validam ou treinam esses avaliadores. Para um modelo novo, a parte humana significa pessoas a ver rollouts, a marcar onde deixam de fazer sentido físico e a compará-los, sem saberem que modelo os produziu.

Que benchmarks de modelos de mundo usam juízos humanos?

O VBench recolheu anotações de preferência humana para cada uma das suas dimensões, para mostrar que as suas classificações automáticas coincidem com as pessoas. O WorldModelBench recolheu por crowdsourcing 67 000 rótulos humanos sobre 14 modelos e usou-os para afinar um juiz automático.

Que ferramenta posso usar para anotar episódios de robôs?

O ATLAS é uma ferramenta de secretária para um anotador segmentar episódios longos a partir de ROS bags ou RLDS. O Potato anota episódios no navegador para vários anotadores, importa LeRobot v2, HDF5 e RLDS/TFDS, e reporta a concordância sobre limites de fase, resultados e curvas de recompensa.

Como meço a concordância entre pessoas que avaliam vídeos gerados?

Faça com que cada rollout seja avaliado por pelo menos dois avaliadores que não saibam que modelo o produziu. Reporte se concordam que há rutura, quão próximos estão os seus pontos de rutura em várias tolerâncias e se atribuem a mesma categoria. O rollout_evaluation do Potato reporta estas três coisas em separado.

Leituras adicionais