Skip to content

Strumenti di valutazione di world model ed episodi robotici a confronto

I benchmark, i visualizzatori e gli strumenti di annotazione usati per valutare video generati, world model ed episodi robotici: VBench, WorldModelBench, Physics-IQ, ATLAS, Rerun e Potato.

I world model e i generatori di video si valutano con benchmark come VBench, WorldModelBench e Physics-IQ, che definiscono cosa misurare e forniscono valutatori automatici. Quei valutatori vengono verificati rispetto ai giudizi umani. Raccogliere giudizi umani difendibili, con valutatori che non sanno quale modello ha prodotto ogni video e con l'accordo riportato, è lavoro di annotazione. Potato ha schemi per giudicare rollout generati e per segmentare episodi robotici.

Un world model prevede come cambierà una scena, spesso a partire da un'azione, e un modello di generazione video può essere valutato come tale chiedendosi se il suo output rispetta la fisica e segue l'istruzione ricevuta. Un rollout è una continuazione generata. Un episodio robotico è la registrazione di un tentativo di svolgere un compito, di solito più flussi video più posizioni dei giunti, stato della pinza e altri segnali.

Questa pagina tratta world model, video generati e robotica. Strumenti di annotazione con IA a confronto copre tutti i tipi di dati in una sola pagina.

Cosa fa ogni strumento

StrumentoCos'èDove intervengono le persone
VBenchSuite di benchmark per la generazione video, Apache-2.0Annotazioni di preferenza umana per ogni dimensione, per verificare che i punteggi automatici concordino con le persone
WorldModelBenchBenchmark dei generatori video come world model67.000 etichette umane raccolte in crowdsourcing, usate anche per addestrare un giudice automatico
Physics-IQBenchmark della comprensione fisica nel video generativo, di Google DeepMindUn punteggio e una classifica
ATLASStrumento desktop per la segmentazione di azioni di lunga durata, con supporto a ROS bag e RLDSUn annotatore per episodio
Rerun, FoxgloveVisualizzazione per la roboticaVisualizzare, non studi di etichettatura
ELAN, BORISCodifica del comportamento nei videoELAN riporta l'affidabilità tra annotatori
CVAT, Label StudioAnnotazione video genericaTracce ed etichette sulla linea temporale, senza schema per i world model
PotatoStrumento di annotazione con gli schemi rollout_evaluation ed episode_annotationPiù annotatori per elemento, pannelli in cieco, accordo riportato

I benchmark definiscono il protocollo

VBench valuta i modelli testo-video su 16 dimensioni, tra cui coerenza del soggetto, fluidità del movimento e relazioni spaziali. VBench-2.0 aggiunge 18 dimensioni su senso comune, fisica, movimento umano e composizione. Per ogni dimensione gli autori hanno raccolto annotazioni di preferenza umana e mostrato che i punteggi automatici le seguono.

WorldModelBench valuta i generatori video sul rispetto delle istruzioni e l'aderenza alla fisica, e rileva violazioni come un oggetto che cambia dimensione violando la conservazione della massa. Gli autori hanno raccolto in crowdsourcing 67.000 etichette umane per valutare 14 modelli di punta, poi hanno affinato un giudice da 2 miliardi di parametri che prevede le violazioni del world model con un'accuratezza superiore dell'8,6% rispetto a GPT-4o (arXiv 2502.20694).

Physics-IQ copre meccanica dei solidi, fluidodinamica, ottica, termodinamica e magnetismo. Testando Sora, Runway, Pika, Lumiere, Stable Video Diffusion e VideoPoet, gli autori hanno trovato una comprensione fisica molto limitata e non legata al realismo visivo (arXiv 2501.09038).

Usali per le metriche e i protocolli di riferimento. Sono il termine di confronto di qualsiasi risultato.

Dove entra il giudizio umano

VBench usa i giudizi umani per validare le sue dimensioni, WorldModelBench per addestrare il suo giudice. Quando valuti il tuo modello, la parte umana va ripetuta a ogni nuovo checkpoint. E allora ha i problemi di qualsiasi studio di annotazione: valutatori che sanno quale modello ha fatto quale video, valutatori in disaccordo su cosa conta come violazione, e nessun valore di accordo che mostri che le etichette sono affidabili.

Giudicare rollout generati in Potato

Lo schema rollout_evaluation mostra due o più rollout su un orologio comune. Chi annota segna il fotogramma in cui il mondo smette di avere senso, indica quale proprietà fisica o causale si è rotta, esprime una preferenza secondo una rubrica e valuta se una divergenza controfattuale è plausibile data l'intervento. I pannelli possono nascondere il modello ed essere mescolati in un ordine stabile per ciascun annotatore, così ricaricare la pagina non rivela quale modello sia quale.

L'accordo sul punto di rottura è riportato in tre modi: se gli annotatori hanno rilevato una rottura, dove l'hanno collocata e quale categoria le hanno dato. La tolleranza di abbinamento è mostrata come una scansione su più valori invece che a una sola soglia.

yaml
annotation_schemes:
  - annotation_type: rollout_evaluation
    name: rollout_review
    description: "Where does each rollout stop making sense?"
    streams:
      - {field: real,  name: "Recording", role: real}
      - {field: gen_a, name: "Model A"}
      - {field: gen_b, name: "Model B"}
    fps: 25
    layers: [violations, preference, counterfactual]
    blind: true
    shuffle: true
    require_clean: true

require_clean rende "nessuna rottura" una risposta esplicita, così un rollout che nessuno ha segnalato si distingue da uno che nessuno ha finito di guardare. Vedi Come valutare video generati e world model.

Annotare episodi robotici

Lo schema episode_annotation mette su un'unica linea temporale più flussi video sincronizzati e tracce di serie temporali del robot (posizioni dei giunti, stato della pinza, forza-coppia, ricompensa). Gli annotatori segmentano le fasi, segnano l'esito di ogni fase, disegnano una ricompensa di avanzamento densa e riformulano l'istruzione a posteriori. Potato importa LeRobot v2, HDF5 (RoboMimic e ALOHA) e RLDS/TFDS, e scrive un file JSONL di accompagnamento per fotogramma, così un dataset pubblico in sola lettura non va riscritto.

L'accordo è riportato come IoU temporale per i confini di fase, α per le etichette di esito e ICC con correlazione di Pearson per le curve di ricompensa, indicando la copertura, perché una correlazione calcolata sul 5% di una linea temporale non dice nulla del resto.

ATLAS, della TU Wien, è uno strumento desktop per la segmentazione di azioni di lunga durata che legge nativamente ROS bag e RLDS. Per un annotatore che colloca i confini con precisione è costruito apposta. Il suo risultato pubblicato, cioè che mostrare le serie temporali propriocettive accanto al video riduce l'errore sui confini rispetto al solo video, è il motivo per cui Potato disegna quelle tracce. Rerun e Foxglove sono i migliori strumenti di visualizzazione per la robotica, ed ELAN e BORIS restano lo standard per la codifica del comportamento. Vedi Come annotare episodi robotici.

Per valutare il grounding e il puntamento dei modelli visione-linguaggio, vedi Valutazione del grounding nei VLM.

Cosa non fa Potato qui

  • Nessun valutatore automatico della fisica. Per quello usa il valutatore di un benchmark, e Potato per le etichette umane con cui viene validato.
  • Nessun addestramento né inferenza dei modelli. Potato mostra i rollout che hai generato.
  • Nessuna sequenza di nuvole di punti. L'annotazione 3D è per fotogramma.

Verificato su repository e articolo di ciascun progetto ad agosto e settembre 2026.

Domande frequenti

Come si valutano i world model?

Con benchmark che valutano il video generato per aderenza alla fisica, rispetto delle istruzioni e qualità visiva, come VBench, WorldModelBench e Physics-IQ, e con giudizi umani che validano o addestrano quei valutatori. Per un nuovo modello, la parte umana significa persone che guardano i rollout, segnano dove smettono di avere senso fisico e li confrontano, senza sapere quale modello li ha prodotti.

Quali benchmark per world model usano giudizi umani?

VBench ha raccolto annotazioni di preferenza umana per ciascuna delle sue dimensioni, per mostrare che i suoi punteggi automatici concordano con le persone. WorldModelBench ha raccolto in crowdsourcing 67.000 etichette umane su 14 modelli e le ha usate per affinare un giudice automatico.

Quale strumento posso usare per annotare episodi robotici?

ATLAS è uno strumento desktop per un annotatore che segmenta episodi lunghi da ROS bag o RLDS. Potato annota gli episodi nel browser per più annotatori, importa LeRobot v2, HDF5 e RLDS/TFDS, e riporta l'accordo su confini di fase, esiti e curve di ricompensa.

Come misuro l'accordo tra persone che giudicano video generati?

Fai giudicare ogni rollout da almeno due valutatori che non sanno quale modello l'ha prodotto. Riporta se concordano sul fatto che si rompe, quanto sono vicini i loro punti di rottura su più tolleranze e se assegnano la stessa categoria. rollout_evaluation di Potato riporta questi tre aspetti separatamente.

Approfondimenti