Skip to content

Bildannotationswerkzeuge im Vergleich: CVAT, Label Studio, Roboflow, V7 und Potato

Vergleich von CVAT, Label Studio, Roboflow, V7, Supervisely, Segments.ai, X-AnyLabeling, VIA und Potato für Boxen, Segmentierung, Keypoints, Gigapixelbilder und 3D-Punktwolken.

Für Computer-Vision-Labeling in großem Umfang ist CVAT das maßgebliche quelloffene Werkzeug, und Roboflow, V7 und Supervisely ergänzen als kommerzielle Produkte Modelltraining oder verwaltete Arbeitsabläufe. Potato eignet sich für Bildlabels, die Forschungsdaten sind: Mehrere Annotatoren labeln dieselben Bilder, und die Studie muss berichten, wie gut sie übereinstimmen. Es passt auch, wenn Bilder in einer Studie neben Text, Audio oder Modellausgaben stehen.

Eine Bounding Box ist das Rechteck um ein Objekt. Die Bildsegmentierung ordnet Pixel Objekten zu, als Polygone oder als Masken. Keypoints markieren Orientierungspunkte wie Gelenke, und ein Skelett verbindet sie. Intersection over Union (IoU) misst, wie stark sich zwei Formen überlappen, und die meisten Werkzeuge vergleichen Annotatoren damit.

Diese Seite behandelt Bilder, Gigapixel-Schnitte und 3D-Punktwolken. KI-Annotationswerkzeuge im Vergleich behandelt alle Datentypen auf einer Seite.

Welche Bildannotationswerkzeuge lohnen einen Vergleich?

WerkzeugLäuft alsKostenGeeignet für
PotatoSelbst gehostet (GPL-3.0)KostenlosStudien mit mehreren Annotatoren, die Übereinstimmung berichten
CVATSelbst gehostet (MIT) oder gehostetKostenlos; gehostet 33 $ pro Nutzer und MonatBoxen, Masken und Video-Tracking in großem Umfang
Label StudioSelbst gehostet oder gehostetKostenlose Community Edition; kostenpflichtige Tarife ab 99 $ im MonatBilder in Projekten, die auch Text, Audio oder Video labeln
RoboflowGehostetKommerziellVon Labels zu einem trainierten, bereitgestellten Detektor
V7GehostetKommerziellVerwaltete Arbeitsabläufe, medizinische Bildformate, modellgestütztes Labeling
SuperviselySelbst gehostet oder gehostetCommunity Edition; kommerzielle StufenGroße Bilder, 3D und Modelltraining im selben Produkt
Segments.aiGehostetKommerziell3D-Punktwolken und Sensorfusion
X-AnyLabelingDesktop-AppKostenlosEine Person, die lokal mit vielen Modellen labelt
VIAEine einzelne HTML-Datei, offline im BrowserKostenlos (BSD-2-Clause)Kleine Projekte ohne Installation

Boxen, Polygone und Keypoints

Jedes Werkzeug hier zeichnet Boxen und Polygone. CVAT, Label Studio, Roboflow, V7, Supervisely, Segments.ai und Potato beherrschen außerdem Keypoints mit Skeletten. Potato bietet zusätzlich Polylinien, Ellipsen, 2D-Quader und nach Instanz verschlüsselte Pinselmasken.

Die ausgereiften Computer-Vision-Plattformen hängen an jedes Objekt Attribute, etwa einen Verdeckungsgrad, ein Kennzeichen für Abschneidung oder einen Untertyp. Potato tut das noch nicht. Die Geometrie trägt dort ein Label, und weitere Attribute brauchen ein begleitendes Schema.

Segmentierung mit Hilfe eines Modells

Interaktive Segmentierung macht aus einem Klick oder einem groben Umriss eine enge Maske. Potato führt sie im Browser aus, ohne dass eine GPU bereitgestellt werden muss. CVAT erreicht sie über Nuclio-Funktionen oder seinen KI-Agenten-Weg, Label Studio über ein ML-Backend. Roboflow, V7, Supervisely und Segments.ai haben sie ins Produkt eingebaut.

Segmentierung per Textprompt liefert eine Maske für ein Objekt, das man benennt. Potato führt sie im Browser mit einem Modell unter Apache-2.0 aus. Roboflow und V7 nutzen SAM 3 auf ihren Servern, Supervisely bietet sie über Apps an und Label Studio über ein ML-Backend. X-AnyLabeling bündelt Grounding DINO, Grounded-SAM 2, SAM 2.1 und YOLO in einer Desktop-App und ist für eine Person, die lokal mit vielen Modellen labelt, kaum zu schlagen. Der Vorteil von Potato beginnt, sobald es mehr als einen Annotator gibt.

Siehe Bildsegmentierungsmasken annotieren und Objekte durch Eintippen ihres Namens labeln.

Gigapixelbilder und Pathologieschnitte

Potato baut eine Kachelpyramide, die sowohl als DZI als auch als IIIF Image API 3.0 ausgeliefert wird. Pinselmasken arbeiten in der vollen Auflösung der Quelle, weil der Maskenpuffer Bildpixel indiziert und keine GPU-Textur, sodass es keine Obergrenze für die Texturgröße gibt. 16-Bit-TIFFs aus der Wissenschaft erhalten ein Perzentilfenster, damit schwache Strukturen sichtbar bleiben. V7 und Supervisely verarbeiten ebenfalls sehr große Bilder, CVAT teilweise. Siehe Gigapixel-Bildannotation mit Deep Zoom.

Für die digitale Pathologie sind QuPath (quelloffene Desktop-App, der Standard des Fachs) und Cytomine (quelloffene Web-App mit verblindeter Annotation durch mehrere Nutzer) eigens dafür gebaut. Potato liest weder SVS noch DICOM noch NIfTI.

3D-Punktwolken

Potato annotiert PCD-, PLY-, LAS-, KITTI-.bin- und .xyz-Wolken mit 3D-Quadern, Punkten, Polylinien und Segmenten pro Punkt. Die Rotation der Quader wird als Quaternion gespeichert, sodass Nick- und Rollwinkel eine Hin- und Rückkonvertierung überstehen, und Quader werden mit exakter gedrehter 3D-IoU verglichen. Annotiert wird Frame für Frame.

Segments.ai, Kognic, Deepen AI, Supervisely und Xtreme1/BasicAI sind Spezialisten und für produktive Pipelines im autonomen Fahren weiter: Arbeitsabläufe über Sequenzen mit Track-Propagation, Unterstützung für Radar und mehrere LiDARs sowie automatisch eingepasste Quader. CVAT, Supervisely und Segments.ai verarbeiten Punktwolkensequenzen, Potato nicht. Siehe 3D-Punktwolken annotieren.

Übereinstimmung bei Bildlabels messen

Die meisten Computer-Vision-Werkzeuge vergleichen Annotatoren über die Überlappung. Die Konsens-Engine von CVAT und die Konsensstufe von V7 vergleichen Annotatoren mit roher IoU gegen einen Schwellenwert pro Klasse, und Label Studio Enterprise führt exakte Übereinstimmung, numerische Differenz, IoU und Span-Überlappung auf. Keines dieser Maße korrigiert für den Zufall, und die IoU zweier Boxen auf einem großen Objekt ist hoch, selbst wenn beide nachlässig gezeichnet sind.

Potato berichtet die Übereinstimmung über Geometrie mit einer empirischen Zufallsbasis. Wir haben keine andere Annotationsplattform gefunden, die zufallskorrigierte Übereinstimmung über räumliche Labels berichtet. Inter-Annotator-Übereinstimmung bei Bounding Boxes messen erklärt die Methode.

Vorannotation bringt ein zweites Problem mit sich. Annotatoren, die Modellvorschläge ungeprüft übernehmen, heben jeden Übereinstimmungswert an und senken dabei die Genauigkeit. Potato zeichnet die Zeitverläufe beim Zeichnen auf, die einen geprüften Vorschlag von einem durchgewinkten unterscheiden. Siehe Durchgewinkte Vorannotationen erkennen.

Formate

Potato importiert 15 Computer-Vision-Formate, von denen 11 in beide Richtungen funktionieren. Es exportiert COCO, YOLO, Pascal VOC, CVAT, LabelMe, Cityscapes, KITTI, V7 Darwin, PNG-Masken, MOT und DAVIS. Siehe Computer-Vision-Formate.

Eine Bounding-Box-Aufgabe mit zwei Annotatoren pro Bild

yaml
agreement_metrics:
  enabled: true
 
annotation_schemes:
  - annotation_type: image_annotation
    name: objects
    description: "Draw a tight box around every vehicle."
    source_field: image
    tools: [bbox]
    labels:
      - {name: car, color: "#FF6B6B"}
      - {name: truck, color: "#4ECDC4"}
 
num_annotators_per_item:
  default: 2

Jedes Bild geht an zwei Annotatoren, und das Admin-Dashboard berichtet ihre Übereinstimmung über die Boxen.

Was Potato bei Bildern nicht kann

  • Kein Modelltraining. Potato annotiert mit vorhandenen Modellen vor, trainiert aber keine Detektoren. Roboflow, V7, Supervisely und Labelbox tun das.
  • Noch keine Attribute pro Objekt.
  • Keine Punktwolkensequenzen. 3D-Annotation erfolgt Frame für Frame.
  • Kein DICOM, NIfTI oder Whole-Slide-Format.
  • Keine verwalteten Annotatoren. Bringen Sie Ihre eigenen mit oder rekrutieren Sie sie über Prolific.

Geprüft anhand der Dokumentation und der Preisseite jedes Projekts im August und September 2026.

Häufige Fragen

Was ist das beste kostenlose Bildannotationswerkzeug?

Für umfangreiche Arbeit, die ausschließlich Computer Vision ist, ist CVAT kostenlos, ausgereift und selbst gehostet. Für Bilder in einem Projekt, das auch Text oder Audio labelt, decken die Community Edition von Label Studio und Potato beide die Bandbreite ab. Für Studien, in denen mehrere Annotatoren dieselben Bilder labeln und Übereinstimmung berichtet werden muss, enthält Potato das kostenlos. Für eine Handvoll Bilder ohne Installation läuft VIA aus einer einzigen HTML-Datei.

Gibt es eine quelloffene Alternative zu Labelbox?

CVAT, die Community Edition von Label Studio und Potato sind quelloffen und selbst gehostet. Labelbox verkauft eine verwaltete Plattform und dazu Annotatoren. Die quelloffenen Werkzeuge liefern Software, keine Annotatoren, also bringen Sie Ihr eigenes Team mit oder rekrutieren über eine Plattform wie Prolific.

Kann ich modellgestützte Segmentierung ohne GPU-Server betreiben?

Ja. Potato führt interaktive und textgesteuerte Segmentierung im Browser über ONNX Runtime Web aus, und sie funktioniert ohne Netzverbindung, sobald die Modellgewichte auf dem Rechner liegen. Die Maskenpropagation mit SAM 2 für Video läuft auf dem Server. X-AnyLabeling führt Modelle lokal auf dem Desktop aus. CVAT und Label Studio rufen einen Modellserver auf.

Wie messe ich die Übereinstimmung zwischen Annotatoren bei Bounding Boxes?

Geben Sie jedes Bild an mindestens zwei Annotatoren, ordnen Sie ihre Boxen einander zu und berichten Sie eine Übereinstimmung, die den Zufall berücksichtigt, denn rohe IoU ist bei großen Objekten hoch, egal was die Annotatoren tun. Der Leitfaden zur Übereinstimmung bei Bounding Boxes behandelt die Zuordnung, die Zufallsbasis und was zu berichten ist.

Welches Annotationswerkzeug eignet sich für 3D-Punktwolken?

Für produktive Fahrdaten mit Sequenzen und Track-Propagation nehmen Sie einen Spezialisten wie Segments.ai, Kognic oder Supervisely, oder CVAT, wenn es quelloffen sein muss. Für Quader pro Frame, bei denen Sie Übereinstimmungsstatistiken brauchen, oder wenn 3D ein Teil einer multimodalen Studie ist, passt Potato.

Weiterführende Lektüre