Skip to content

Videoannotationswerkzeuge im Vergleich: CVAT, Label Studio, ELAN, BORIS und Potato

Vergleich von CVAT, Label Studio, ELAN, BORIS, VIA, V7 und Potato für Objekt-Tracking, zeitliche Segmente, Verhaltenskodierung und Maskenpropagation, und wie jedes Übereinstimmung misst.

Videoannotation ist meist eine von zwei Aufgaben. Beim Objekt-Tracking wird eine Form um etwas gezeichnet und über die Frames verfolgt; dafür ist CVAT das maßgebliche quelloffene Werkzeug. Bei der zeitlichen Annotation wird markiert, wann etwas geschieht; ELAN und BORIS sind dafür die Standards in Linguistik und Verhaltensforschung. Potato erledigt beides im Browser für Studien mit mehreren Annotatoren und berichtet, wie gut sie übereinstimmen, wann Ereignisse beginnen und enden.

Das Objekt-Tracking verfolgt ein Objekt durch ein Video, meist indem es auf Keyframes gezeichnet und in den Frames dazwischen interpoliert wird. Ein zeitliches Segment besteht aus Startzeit, Endzeit und einem Label, etwa einer Handlung oder einem Sprecherwechsel. Die Maskenpropagation überträgt eine Segmentierungsmaske mit Hilfe eines Modells von einem Frame auf den nächsten.

Diese Seite behandelt Video. KI-Annotationswerkzeuge im Vergleich behandelt alle Datentypen auf einer Seite.

Welche Videoannotationswerkzeuge lohnen einen Vergleich?

WerkzeugLäuft alsLizenz und KostenGeeignet für
PotatoWeb-App, selbst gehostetGPL-3.0, kostenlosStudien mit mehreren Annotatoren: Tracking, zeitliche Segmente, Fragen pro Segment, Übereinstimmung
CVATSelbst gehostet oder gehostetMIT; gehostet 33 $ pro Nutzer und MonatTracking von Boxen, Polygonen und Punkten in großem Umfang
Label StudioSelbst gehostet oder gehostetApache-2.0 Community Edition, mit kostenpflichtigen TarifenObjekt-Tracking mit VideoRectangle, Labels über Frame-Bereiche mit TimelineLabels
ELANDesktop-AppGPL-3.0Zeitlich ausgerichtete Ebenen über bis zu vier verknüpfte Videos
BORISDesktop-App für Linux, Windows, macOS und AndroidGPL-3.0Verhaltensereignisse aus Video, Audio oder Live-Beobachtung protokollieren
ProdigyLokal betriebene Web-AppProprietärRegionen mit Zeitstempeln auf einem Video über seine Audio-Oberflächen
VIA 3Eine einzelne HTML-Datei, offline im BrowserBSD-2-ClauseKleine Videoprojekte ohne Installation
V7, SuperviselyGehostet; Supervisely auch selbst gehostetKommerziellTracking mit modellbasierter Maskenpropagation und verwalteten Arbeitsabläufen

Objekte über Frames verfolgen

Der Track-Modus von CVAT verknüpft Formen auf verschiedenen Frames als ein Objekt. Die annotierende Person passt die Form auf einigen Keyframes an, und CVAT interpoliert die Frames dazwischen linear, für Rechtecke, Polygone und Punkte. Das Tag VideoRectangle von Label Studio bringt Objekt-Tracking in Videos, für Boxen. V7, Supervisely und Segments.ai verfolgen mit Interpolation und propagieren Masken mit einem Modell.

Das Schema video_annotation von Potato hat einen Tracking-Modus, der Boxen und Polygone zwischen Keyframes interpoliert. Die Maskenpropagation mit SAM 2 läuft auf dem Server. Der Browser hat einen leichteren Pfad, der die Maske weiterträgt. Siehe Video-Objekt-Tracking annotieren.

Markieren, wann etwas geschieht

Das Tag TimelineLabels von Label Studio labelt einen einzelnen Frame per Klick oder einen Bereich von Frames per Ziehen. ELAN hängt Annotationen auf so vielen Ebenen an die Zeitachse, wie das Schema braucht, mit kontrollierten Vokabularen und bis zu vier synchronisierten Videos. BORIS protokolliert und kodiert Verhaltensereignisse aus Video, Audio oder Live-Beobachtung. Prodigy hält Regionen anhand von Video-Zeitstempeln fest, und VIA 3 annotiert Video ebenso wie Bilder und Audio.

In Potato werden zeitliche Segmente auf einer Zeitleiste gelabelt. Seit Version 2.9 setzt segment_schemes jeden Annotationstyp in ein Segment, sodass jedes Segment eine eigene Bewertung oder Freitextfrage tragen kann. Siehe Videoannotation.

Übereinstimmung bei Videoannotationen

Zwei Annotatoren, die markieren, wann ein Ereignis beginnt, wählen nicht denselben Frame. Die zeitliche Übereinstimmung hängt also davon ab, wie weit zwei Markierungen auseinanderliegen dürfen und trotzdem als dieselbe gelten.

  • ELAN hat eine eingebaute Berechnung der Inter-Annotator-Reliabilität: ein modifiziertes Cohens κ, das Annotationen mit einer festgelegten Mindestüberlappung verknüpft, und den Staccato-Algorithmus, der den Zufall berücksichtigt, indem er eine Segmentierung mit zufällig erzeugten vergleicht.
  • Potato berichtet die zeitliche IoU für die Überlappung, α für die Lage der Grenzen, α über die Labels und α dafür, ob überhaupt ein Ereignis markiert wurde, und zeigt die Toleranz für die Zuordnung als Sweep über mehrere Werte. Die Dokumentation nennt eine Einschränkung: Für die Überlappung von Segmenten gibt es noch keine Zufallsbasis. Siehe Übereinstimmung über die Zeit.
  • Die Konsens-Engine von CVAT vergleicht Annotatoren mit roher IoU gegen einen Schwellenwert pro Klasse.

Für Tracks und Masken vergleicht Potato Masken Frame für Frame mit Maskenkonsens und STAPLE und Boxen mit der Geometrie-Übereinstimmung, die in Inter-Annotator-Übereinstimmung bei Bounding Boxes messen beschrieben ist.

Formate

Potato exportiert MOT für Tracks, DAVIS für Masken der Video-Objektsegmentierung und EAF für zeitlich ausgerichtete Annotationen, die ELAN öffnet. Siehe Computer-Vision-Formate.

Eine Tracking-Aufgabe in Potato

yaml
annotation_schemes:
  - annotation_type: video_annotation
    name: tracks
    description: "Draw the object once, then press Track forward."
    source_field: video_url
    mode: tracking
    labels:
      - {name: subject, color: "#d1495b"}
    tracking_options:
      interpolation: linear
      auto_advance_frames: 5
    video_fps: 12
    frame_stepping: true

Mit frame_stepping gehen Annotatoren Frame für Frame voran, und auto_advance_frames legt fest, wie weit „Track forward“ springt.

Was Potato bei Video nicht kann

  • Noch keine Attribute pro Objekt. Ein Track trägt ein Label. Kennzeichen für Verdeckung und Abschneidung brauchen ein begleitendes Schema.
  • Keine Maskenpropagation im Browser. Die Propagation mit SAM 2 läuft auf dem Server.
  • Keine verwalteten Annotatoren. Bringen Sie Ihre eigenen mit oder rekrutieren Sie sie über Prolific.

Geprüft anhand der Dokumentation jedes Projekts im August und September 2026.

Häufige Fragen

Was ist das beste kostenlose Videoannotationswerkzeug?

Für das Tracking von Objekten in großem Umfang ist CVAT kostenlos, ausgereift und selbst gehostet. Für die Kodierung von Verhalten oder Sprache über die Zeit sind ELAN und BORIS kostenlose Desktop-Werkzeuge. Für eine Studie, in der mehrere Annotatoren dieselben Videos im Browser labeln und Übereinstimmung berichtet werden muss, enthält Potato das kostenlos.

Welche Videoannotationswerkzeuge interpolieren zwischen Keyframes?

Der Track-Modus von CVAT interpoliert Rechtecke, Polygone und Punkte linear zwischen Keyframes. Der Tracking-Modus von Potato interpoliert Boxen und Polygone. V7 und Supervisely interpolieren und propagieren Masken zusätzlich mit einem Modell. VideoRectangle von Label Studio verfolgt Boxen.

Was sollte ich für die Verhaltenskodierung von Video verwenden?

BORIS und ELAN sind die etablierten kostenlosen Werkzeuge, und ELAN kann die Inter-Annotator-Reliabilität zwischen Paaren von Ebenen berechnen. Für ein Kodierschema, das mehrere Kodierende im Browser anwenden, mit Übereinstimmung über alle hinweg, eignen sich die zeitlichen Segmente von Potato.

Wie wird Übereinstimmung bei Videoannotationen gemessen?

Für Ereignisse ordnet man die Segmente jedes Annotators innerhalb einer Toleranz einander zu und berichtet Überlappung, Übereinstimmung der Grenzen und Übereinstimmung der Labels, am besten über mehrere Toleranzen, denn Übereinstimmung bei einer Viertelsekunde und bei zwei Sekunden sind unterschiedliche Aussagen. Für Tracks vergleicht man die Formen Frame für Frame, mit IoU für Boxen und Masken.

Wo läuft die Maskenpropagation für Video in Potato?

Auf dem Server, mit SAM 2. Der Browser hat einen leichteren Pfad, der eine Maske ohne das Modell in den nächsten Frame überträgt.

Weiterführende Lektüre