Skip to content

Werkzeuge zur Evaluation von Weltmodellen und Roboterepisoden im Vergleich

Die Benchmarks, Visualisierer und Annotationswerkzeuge zur Evaluation von generiertem Video, Weltmodellen und Roboterepisoden: VBench, WorldModelBench, Physics-IQ, ATLAS, Rerun und Potato.

Weltmodelle und Videogeneratoren werden mit Benchmarks wie VBench, WorldModelBench und Physics-IQ evaluiert, die festlegen, was gemessen wird, und automatische Bewerter mitliefern. Diese Bewerter werden an menschlichen Urteilen überprüft. Menschliche Urteile zu sammeln, die einer Prüfung standhalten, mit Bewertenden, die das Modell nicht kennen, und mit berichteter Übereinstimmung, ist Annotationsarbeit. Potato hat Schemata, um generierte Rollouts zu beurteilen und Roboterepisoden zu segmentieren.

Ein Weltmodell sagt vorher, wie sich eine Szene verändert, oft in Abhängigkeit von einer Aktion, und ein Videogenerierungsmodell lässt sich als solches evaluieren, indem man fragt, ob seine Ausgabe der Physik gehorcht und der Anweisung folgt, die es erhalten hat. Ein Rollout ist eine generierte Fortsetzung. Eine Roboterepisode ist die Aufzeichnung eines Versuchs, eine Aufgabe zu lösen, meist mehrere Kamerastreams plus Gelenkstellungen, Greiferzustand und weitere Signale.

Diese Seite behandelt Weltmodelle, generiertes Video und Robotik. KI-Annotationswerkzeuge im Vergleich behandelt alle Datentypen auf einer Seite.

Was jedes Werkzeug leistet

WerkzeugWas es istWo Menschen ins Spiel kommen
VBenchBenchmark-Suite für Videogenerierung, Apache-2.0Menschliche Präferenzannotationen für jede Dimension, um zu prüfen, ob die automatischen Werte mit Menschen übereinstimmen
WorldModelBenchBenchmark für Videogeneratoren als Weltmodelle67.000 per Crowdsourcing gesammelte menschliche Labels, auch zum Training eines automatischen Judges verwendet
Physics-IQBenchmark für physikalisches Verständnis in generativem Video, von Google DeepMindEin Score und eine Rangliste
ATLASDesktop-Werkzeug für die Segmentierung langer Handlungsabläufe, mit Unterstützung für ROS-Bags und RLDSEine annotierende Person pro Episode
Rerun, FoxgloveVisualisierung für die RobotikBetrachten, keine Labeling-Studien
ELAN, BORISVerhaltenskodierung von VideoELAN berichtet Inter-Annotator-Reliabilität
CVAT, Label StudioAllgemeine VideoannotationTracks und Zeitleisten-Labels, ohne Schema für Weltmodelle
PotatoAnnotationswerkzeug mit den Schemata rollout_evaluation und episode_annotationMehrere Annotatoren pro Item, verblindete Panels, berichtete Übereinstimmung

Benchmarks legen das Protokoll fest

VBench bewertet Text-zu-Video-Modelle in 16 Dimensionen, darunter Konsistenz des Motivs, Flüssigkeit der Bewegung und räumliche Beziehungen. VBench-2.0 fügt 18 Dimensionen zu Alltagsverständnis, Physik, menschlicher Bewegung und Komposition hinzu. Für jede Dimension sammelten die Autoren menschliche Präferenzannotationen und zeigten, dass die automatischen Werte ihnen folgen.

WorldModelBench evaluiert Videogeneratoren auf Befolgen der Anweisung und physikalische Plausibilität und erkennt Verstöße wie ein Objekt, das entgegen der Massenerhaltung seine Größe ändert. Die Autoren sammelten per Crowdsourcing 67.000 menschliche Labels, um 14 führende Modelle zu evaluieren, und trainierten dann einen Judge mit 2 Milliarden Parametern nach, der Verstöße gegen das Weltmodell mit 8,6 % höherer Genauigkeit vorhersagt als GPT-4o (arXiv 2502.20694).

Physics-IQ deckt Festkörpermechanik, Fluiddynamik, Optik, Thermodynamik und Magnetismus ab. Beim Test von Sora, Runway, Pika, Lumiere, Stable Video Diffusion und VideoPoet fanden die Autoren, dass das physikalische Verständnis stark begrenzt ist und nicht mit visuellem Realismus zusammenhängt (arXiv 2501.09038).

Nutzen Sie diese für die Metriken und die Referenzprotokolle. An ihnen wird ein Ergebnis gemessen.

Wo menschliches Urteil ins Spiel kommt

VBench nutzt menschliche Urteile, um seine Dimensionen zu validieren, WorldModelBench, um seinen Judge zu trainieren. Wenn Sie Ihr eigenes Modell evaluieren, muss der menschliche Teil für jeden neuen Checkpoint wiederholt werden. Dann hat er die Probleme jeder Annotationsstudie: Bewertende, die wissen, welches Modell welches Video erzeugt hat, Bewertende, die sich uneinig sind, was als Verstoß zählt, und keine Übereinstimmungszahl, die zeigt, dass den Labels zu trauen ist.

Generierte Rollouts in Potato beurteilen

Das Schema rollout_evaluation zeigt zwei oder mehr Rollouts auf einer gemeinsamen Uhr. Die annotierende Person markiert den Frame, an dem die Welt keinen Sinn mehr ergibt, benennt, welche physikalische oder kausale Eigenschaft gebrochen wurde, gibt eine Präferenz anhand einer Rubrik an und bewertet, ob eine kontrafaktische Abweichung angesichts des Eingriffs plausibel ist. Panels lassen sich verblinden und für jede annotierende Person in stabiler Reihenfolge mischen, sodass ein Neuladen nicht verrät, welches Modell welches ist.

Die Übereinstimmung beim Bruchpunkt wird auf drei Arten berichtet: ob die Annotatoren überhaupt einen Bruch erkannt haben, wo sie ihn gesetzt haben und welche Kategorie sie ihm gegeben haben. Die Toleranz für die Zuordnung wird als Sweep über mehrere Werte gezeigt statt an einem einzigen Schwellenwert.

yaml
annotation_schemes:
  - annotation_type: rollout_evaluation
    name: rollout_review
    description: "Where does each rollout stop making sense?"
    streams:
      - {field: real,  name: "Recording", role: real}
      - {field: gen_a, name: "Model A"}
      - {field: gen_b, name: "Model B"}
    fps: 25
    layers: [violations, preference, counterfactual]
    blind: true
    shuffle: true
    require_clean: true

require_clean macht „kein Bruch“ zu einer ausdrücklichen Antwort, sodass sich ein Rollout, den niemand markiert hat, von einem unterscheiden lässt, den niemand zu Ende angesehen hat. Siehe Generiertes Video und Weltmodelle evaluieren.

Roboterepisoden annotieren

Das Schema episode_annotation legt mehrere synchronisierte Videostreams und Zeitreihenspuren des Roboters (Gelenkstellungen, Greiferzustand, Kraft-Moment, Belohnung) auf eine Zeitleiste. Annotatoren segmentieren Phasen, markieren das Ergebnis jeder Phase, zeichnen eine dichte Fortschrittsbelohnung und formulieren die Anweisung nachträglich neu. Potato importiert LeRobot v2, HDF5 (RoboMimic und ALOHA) und RLDS/TFDS und schreibt eine JSONL-Begleitdatei pro Frame, sodass ein schreibgeschützter öffentlicher Datensatz nicht umgeschrieben werden muss.

Die Übereinstimmung wird als zeitliche IoU für Phasengrenzen, als α für Ergebnislabels und als ICC mit Pearson-Korrelation für Belohnungskurven berichtet, jeweils mit angegebener Abdeckung, denn eine Korrelation über 5 % einer Zeitleiste sagt nichts über den Rest.

ATLAS von der TU Wien ist ein Desktop-Werkzeug für die Segmentierung langer Handlungsabläufe, das ROS-Bags und RLDS nativ liest. Für eine annotierende Person, die Grenzen präzise setzt, ist es eigens dafür gebaut. Sein veröffentlichtes Ergebnis, dass propriozeptive Zeitreihen neben dem Video den Grenzfehler gegenüber reinem Video verringern, ist der Grund, warum Potato diese Spuren zeichnet. Rerun und Foxglove sind die besten Visualisierungswerkzeuge für die Robotik, und ELAN und BORIS bleiben die Standards für Verhaltenskodierung. Siehe Roboterepisoden annotieren.

Zur Evaluation von Verortung und Zeigen bei Vision-Language-Modellen siehe VLM-Grounding evaluieren.

Was Potato hier nicht kann

  • Kein automatischer Physik-Bewerter. Dafür nehmen Sie den Bewerter eines Benchmarks und Potato für die menschlichen Labels, an denen er validiert wird.
  • Kein Modelltraining und keine Inferenz. Potato zeigt die Rollouts, die Sie generiert haben.
  • Keine Punktwolkensequenzen. 3D-Annotation erfolgt Frame für Frame.

Geprüft anhand des Repositorys und des Papers jedes Projekts im August und September 2026.

Häufige Fragen

Wie werden Weltmodelle evaluiert?

Mit Benchmarks, die generiertes Video auf physikalische Plausibilität, Befolgen der Anweisung und visuelle Qualität bewerten, etwa VBench, WorldModelBench und Physics-IQ, und mit menschlichen Urteilen, die diese Bewerter validieren oder trainieren. Bei einem neuen Modell heißt der menschliche Teil: Menschen sehen sich Rollouts an, markieren, wo sie physikalisch keinen Sinn mehr ergeben, und vergleichen sie, ohne zu wissen, von welchem Modell sie stammen.

Welche Benchmarks für Weltmodelle nutzen menschliche Urteile?

VBench sammelte für jede seiner Dimensionen menschliche Präferenzannotationen, um zu zeigen, dass seine automatischen Werte mit Menschen übereinstimmen. WorldModelBench sammelte per Crowdsourcing 67.000 menschliche Labels über 14 Modelle und trainierte damit einen automatischen Judge nach.

Mit welchem Werkzeug kann ich Roboterepisoden annotieren?

ATLAS ist ein Desktop-Werkzeug für eine annotierende Person, die lange Episoden aus ROS-Bags oder RLDS segmentiert. Potato annotiert Episoden im Browser für mehrere Annotatoren, importiert LeRobot v2, HDF5 und RLDS/TFDS und berichtet die Übereinstimmung bei Phasengrenzen, Ergebnissen und Belohnungskurven.

Wie messe ich die Übereinstimmung zwischen Menschen, die generierte Videos beurteilen?

Lassen Sie jeden Rollout von mindestens zwei Bewertenden beurteilen, die nicht sehen, welches Modell ihn erzeugt hat. Berichten Sie, ob sie übereinstimmen, dass er überhaupt bricht, wie nah ihre Bruchpunkte über mehrere Toleranzen beieinanderliegen und ob sie dieselbe Kategorie vergeben. rollout_evaluation in Potato berichtet diese drei getrennt.

Weiterführende Lektüre