Strumenti di valutazione di world model ed episodi robotici a confronto
I benchmark, i visualizzatori e gli strumenti di annotazione usati per valutare video generati, world model ed episodi robotici: VBench, WorldModelBench, Physics-IQ, ATLAS, Rerun e Potato.
I world model e i generatori di video si valutano con benchmark come VBench, WorldModelBench e Physics-IQ, che definiscono cosa misurare e forniscono valutatori automatici. Quei valutatori vengono verificati rispetto ai giudizi umani. Raccogliere giudizi umani difendibili, con valutatori che non sanno quale modello ha prodotto ogni video e con l'accordo riportato, è lavoro di annotazione. Potato ha schemi per giudicare rollout generati e per segmentare episodi robotici.
Un world model prevede come cambierà una scena, spesso a partire da un'azione, e un modello di generazione video può essere valutato come tale chiedendosi se il suo output rispetta la fisica e segue l'istruzione ricevuta. Un rollout è una continuazione generata. Un episodio robotico è la registrazione di un tentativo di svolgere un compito, di solito più flussi video più posizioni dei giunti, stato della pinza e altri segnali.
Questa pagina tratta world model, video generati e robotica. Strumenti di annotazione con IA a confronto copre tutti i tipi di dati in una sola pagina.
Cosa fa ogni strumento
| Strumento | Cos'è | Dove intervengono le persone |
|---|---|---|
| VBench | Suite di benchmark per la generazione video, Apache-2.0 | Annotazioni di preferenza umana per ogni dimensione, per verificare che i punteggi automatici concordino con le persone |
| WorldModelBench | Benchmark dei generatori video come world model | 67.000 etichette umane raccolte in crowdsourcing, usate anche per addestrare un giudice automatico |
| Physics-IQ | Benchmark della comprensione fisica nel video generativo, di Google DeepMind | Un punteggio e una classifica |
| ATLAS | Strumento desktop per la segmentazione di azioni di lunga durata, con supporto a ROS bag e RLDS | Un annotatore per episodio |
| Rerun, Foxglove | Visualizzazione per la robotica | Visualizzare, non studi di etichettatura |
| ELAN, BORIS | Codifica del comportamento nei video | ELAN riporta l'affidabilità tra annotatori |
| CVAT, Label Studio | Annotazione video generica | Tracce ed etichette sulla linea temporale, senza schema per i world model |
| Potato | Strumento di annotazione con gli schemi rollout_evaluation ed episode_annotation | Più annotatori per elemento, pannelli in cieco, accordo riportato |
I benchmark definiscono il protocollo
VBench valuta i modelli testo-video su 16 dimensioni, tra cui coerenza del soggetto, fluidità del movimento e relazioni spaziali. VBench-2.0 aggiunge 18 dimensioni su senso comune, fisica, movimento umano e composizione. Per ogni dimensione gli autori hanno raccolto annotazioni di preferenza umana e mostrato che i punteggi automatici le seguono.
WorldModelBench valuta i generatori video sul rispetto delle istruzioni e l'aderenza alla fisica, e rileva violazioni come un oggetto che cambia dimensione violando la conservazione della massa. Gli autori hanno raccolto in crowdsourcing 67.000 etichette umane per valutare 14 modelli di punta, poi hanno affinato un giudice da 2 miliardi di parametri che prevede le violazioni del world model con un'accuratezza superiore dell'8,6% rispetto a GPT-4o (arXiv 2502.20694).
Physics-IQ copre meccanica dei solidi, fluidodinamica, ottica, termodinamica e magnetismo. Testando Sora, Runway, Pika, Lumiere, Stable Video Diffusion e VideoPoet, gli autori hanno trovato una comprensione fisica molto limitata e non legata al realismo visivo (arXiv 2501.09038).
Usali per le metriche e i protocolli di riferimento. Sono il termine di confronto di qualsiasi risultato.
Dove entra il giudizio umano
VBench usa i giudizi umani per validare le sue dimensioni, WorldModelBench per addestrare il suo giudice. Quando valuti il tuo modello, la parte umana va ripetuta a ogni nuovo checkpoint. E allora ha i problemi di qualsiasi studio di annotazione: valutatori che sanno quale modello ha fatto quale video, valutatori in disaccordo su cosa conta come violazione, e nessun valore di accordo che mostri che le etichette sono affidabili.
Giudicare rollout generati in Potato
Lo schema rollout_evaluation mostra due o più rollout su un orologio comune. Chi annota segna il fotogramma in cui il mondo smette di avere senso, indica quale proprietà fisica o causale si è rotta, esprime una preferenza secondo una rubrica e valuta se una divergenza controfattuale è plausibile data l'intervento. I pannelli possono nascondere il modello ed essere mescolati in un ordine stabile per ciascun annotatore, così ricaricare la pagina non rivela quale modello sia quale.
L'accordo sul punto di rottura è riportato in tre modi: se gli annotatori hanno rilevato una rottura, dove l'hanno collocata e quale categoria le hanno dato. La tolleranza di abbinamento è mostrata come una scansione su più valori invece che a una sola soglia.
annotation_schemes:
- annotation_type: rollout_evaluation
name: rollout_review
description: "Where does each rollout stop making sense?"
streams:
- {field: real, name: "Recording", role: real}
- {field: gen_a, name: "Model A"}
- {field: gen_b, name: "Model B"}
fps: 25
layers: [violations, preference, counterfactual]
blind: true
shuffle: true
require_clean: truerequire_clean rende "nessuna rottura" una risposta esplicita, così un rollout che nessuno ha segnalato si distingue da uno che nessuno ha finito di guardare. Vedi Come valutare video generati e world model.
Annotare episodi robotici
Lo schema episode_annotation mette su un'unica linea temporale più flussi video sincronizzati e tracce di serie temporali del robot (posizioni dei giunti, stato della pinza, forza-coppia, ricompensa). Gli annotatori segmentano le fasi, segnano l'esito di ogni fase, disegnano una ricompensa di avanzamento densa e riformulano l'istruzione a posteriori. Potato importa LeRobot v2, HDF5 (RoboMimic e ALOHA) e RLDS/TFDS, e scrive un file JSONL di accompagnamento per fotogramma, così un dataset pubblico in sola lettura non va riscritto.
L'accordo è riportato come IoU temporale per i confini di fase, α per le etichette di esito e ICC con correlazione di Pearson per le curve di ricompensa, indicando la copertura, perché una correlazione calcolata sul 5% di una linea temporale non dice nulla del resto.
ATLAS, della TU Wien, è uno strumento desktop per la segmentazione di azioni di lunga durata che legge nativamente ROS bag e RLDS. Per un annotatore che colloca i confini con precisione è costruito apposta. Il suo risultato pubblicato, cioè che mostrare le serie temporali propriocettive accanto al video riduce l'errore sui confini rispetto al solo video, è il motivo per cui Potato disegna quelle tracce. Rerun e Foxglove sono i migliori strumenti di visualizzazione per la robotica, ed ELAN e BORIS restano lo standard per la codifica del comportamento. Vedi Come annotare episodi robotici.
Per valutare il grounding e il puntamento dei modelli visione-linguaggio, vedi Valutazione del grounding nei VLM.
Cosa non fa Potato qui
- Nessun valutatore automatico della fisica. Per quello usa il valutatore di un benchmark, e Potato per le etichette umane con cui viene validato.
- Nessun addestramento né inferenza dei modelli. Potato mostra i rollout che hai generato.
- Nessuna sequenza di nuvole di punti. L'annotazione 3D è per fotogramma.
Verificato su repository e articolo di ciascun progetto ad agosto e settembre 2026.
Domande frequenti
Come si valutano i world model?
Con benchmark che valutano il video generato per aderenza alla fisica, rispetto delle istruzioni e qualità visiva, come VBench, WorldModelBench e Physics-IQ, e con giudizi umani che validano o addestrano quei valutatori. Per un nuovo modello, la parte umana significa persone che guardano i rollout, segnano dove smettono di avere senso fisico e li confrontano, senza sapere quale modello li ha prodotti.
Quali benchmark per world model usano giudizi umani?
VBench ha raccolto annotazioni di preferenza umana per ciascuna delle sue dimensioni, per mostrare che i suoi punteggi automatici concordano con le persone. WorldModelBench ha raccolto in crowdsourcing 67.000 etichette umane su 14 modelli e le ha usate per affinare un giudice automatico.
Quale strumento posso usare per annotare episodi robotici?
ATLAS è uno strumento desktop per un annotatore che segmenta episodi lunghi da ROS bag o RLDS. Potato annota gli episodi nel browser per più annotatori, importa LeRobot v2, HDF5 e RLDS/TFDS, e riporta l'accordo su confini di fase, esiti e curve di ricompensa.
Come misuro l'accordo tra persone che giudicano video generati?
Fai giudicare ogni rollout da almeno due valutatori che non sanno quale modello l'ha prodotto. Riporta se concordano sul fatto che si rompe, quanto sono vicini i loro punti di rottura su più tolleranze e se assegnano la stessa categoria. rollout_evaluation di Potato riporta questi tre aspetti separatamente.
Approfondimenti
- Strumenti di annotazione con IA a confronto, tutti i tipi di dati in una pagina
- Strumenti di annotazione video a confronto
- Strumenti di annotazione delle immagini a confronto
- Strumenti di valutazione degli agenti IA a confronto
- Strumenti di annotazione del testo a confronto
- Strumenti di annotazione audio a confronto
- Annotazione di episodi robotici