Skip to content

KI-Annotationswerkzeuge im Vergleich: quelloffen und kostenpflichtig

Vergleich von 14 Annotationswerkzeugen und -plattformen für Text, Vision, 3D und Agentenevaluation: welche mit KI vorannotieren und was die jeweilige kostenlose Variante tatsächlich enthält.

Ein Annotationswerkzeug ist Software, die Text, Bildern, Audio, Video oder Modellausgaben Labels zuordnet, sodass sich das Ergebnis zum Trainieren oder Evaluieren eines Systems verwenden lässt. Dieser Leitfaden vergleicht 14 quelloffene und kommerzielle Werkzeuge nach Modalitätsabdeckung, KI-gestützter Annotation, Übereinstimmungsmetriken und dem, was die jeweilige kostenlose Variante tatsächlich enthält.

Ein einzelnes bestes Werkzeug gibt es nicht. Die richtige Wahl hängt davon ab, was Sie annotieren, wie hoch Ihr Budget ist, ob Sie Agenten oder LLMs evaluieren müssen und wie viel Einrichtungsaufwand Sie in Kauf nehmen.

Welche Annotationswerkzeuge sollte ich vergleichen?

WerkzeugLizenzStärkenPassend, wenn
PotatoKostenlos, quelloffen (Forschung)61 Aufgabentypen für Text, Bild, Audio, Video, 3D und Robotik, Agenten- und LLM-Evaluation, YAML ohne Code, Übereinstimmungsmaße eingebautForschung, Agenten-/LLM-Evaluation, schnelle Einrichtung ohne Code
Label StudioQuelloffen + kostenpflichtige StufenBreite Modalitätsunterstützung, ausgefeilte Oberfläche, großes ÖkosystemTeams, die eine kommerziell gestützte Plattform wollen
ProdigyKostenpflichtig (kommerziell)Skriptbar, auf Active Learning ausgelegt, enge spaCy-AnbindungspaCy-Nutzende, denen ein kostenpflichtiges, codegetriebenes Werkzeug liegt
DoccanoQuelloffenSchlicht, aufgeräumt, leicht selbst zu hostenGeradlinige Textklassifikation und NER
bratQuelloffenAusgereifte Annotation von Text und RelationenLinguistische Annotation von Entitäten und Relationen
INCEpTIONQuelloffenReichhaltige linguistische Annotation, Anbindung an WissensbasenTiefgehende linguistische Projekte, die Einrichtungsaufwand investieren können
ArgillaQuelloffenFokus auf LLM-Daten, Hugging-Face-IntegrationSammeln von Feedback-/RLHF-Daten im HF-Stack
CVATQuelloffenBild-/Videoannotation für Computer VisionBounding Boxes, Masken und CV-Labeln auf Video
Labelbox / ScaleKommerziell (kostenpflichtig)Verwaltete Plattform, große Arbeitskräfte-DienstleistungenUnternehmen, die Werkzeug und Labeling-Belegschaft zusammen einkaufen

(Details ändern sich mit der Zeit, prüfe Lizenzen und Funktionen beim jeweiligen Projekt.)

Eines verdeckt die Lizenzspalte: was eine kostenlose Stufe tatsächlich enthält. Die Community-Edition von Label Studio bringt überhaupt keine Maße für Inter-Annotator-Übereinstimmung mit, und Ground-Truth-Markierung sowie die Qualitäts-Dashboards beginnen bei 99 US-Dollar pro Person und Monat. Prodigy hat keine kostenlose Stufe. CVAT führt seine Qualitätskontrolloberfläche als kostenpflichtig. Wenn du nach Qualitätskontrolle statt nach Modalitätsabdeckung auswählst, vergleiche die kostenlosen Editionen, nicht die Marketingseiten. Wir pflegen eine Fähigkeitsmatrix für elf Werkzeuge, abgeglichen mit deren eigener Dokumentation.

Welche Annotationswerkzeuge nutzen KI zur Vorannotation?

„KI-Annotationswerkzeug“ bezeichnet drei Fähigkeiten, die meist als eine verkauft werden, und einem Werkzeug mit der einen fehlen oft die anderen.

  • Modellgestützte Geometrie. Grob klicken oder zeichnen, und ein Segmentierungsmodell zieht die Kontur nach. Potato führt das ohne GPU im Browser aus; CVAT erreicht es über Nuclio oder seinen KI-Agenten-Pfad; Label Studio über ein ML-Backend; Roboflow, V7, Supervisely und Segments.ai liefern es im Produkt mit.
  • Prompt-gesteuerte Annotation. Einen Objektnamen eintippen und eine Maske oder Box zurückbekommen, statt aus einer festen Liste zu wählen. Potato, Roboflow und V7 unterstützen das. Siehe Objekte durch Eintippen ihres Namens annotieren.
  • Vorannotation mit LLMs und VLMs. Ein Modell schlägt Labels für einen ganzen Stapel vor, Annotierende prüfen sie. Potato erreicht dafür 13 Endpunkttypen und kann fertige Annotationen zusätzlich von einem Vision-Language-Modell kritisieren lassen.

Vorannotation verändert, was die Qualitätssicherung abfangen muss. Wer Vorschläge ungelesen übernimmt, treibt jede Übereinstimmungszahl nach oben und die Genauigkeit nach unten; die Bearbeitungsdauer ist das einzige Signal, das echte Prüfung vom Abnicken trennt. Siehe abgenickte Vorannotationen erkennen.

Potato trainiert und betreibt keine Modelle. Es ordnet Items, ruft die Modelle auf, auf die Sie es verweisen, und protokolliert, was die annotierende Person mit dem Ergebnis gemacht hat.

Vision, 3D und Modellevaluation

Potatos Oberflächen für Computer Vision, für Raumdaten und für Evaluation sind jünger als die für Text. Diese Tabelle hält fest, wo das jeweilige Werkzeug stark ist, statt eine Rangfolge zu bilden.

FähigkeitPotatoCVATLabel StudioRoboflowV7SuperviselySegments.ai
Kostenlos selbst hostbarJaJa (MIT)Community-Edition--Community-Edition-
Boxen, Polygone, MaskenJaJaJaJaJaJaJa
Interaktive SegmentierungIm Browser, ohne GPUÜber NuclioÜber ML-BackendJaJaJaJa
Segmentierung per TextpromptJa (im Browser)-Über ML-BackendJa (SAM 3)Ja (SAM 3)Über Apps-
Keypoints / SkeletteJaJaJaJaJaJaJa
Polylinien, Ellipsen, 2D-QuaderJaJaTeilweiseTeilweiseJaJaJa
Attribute pro Objekt-JaJaJaJaJaJa
Video-Tracking mit InterpolationJaJaTeilweiseTeilweiseJaJaJa
Modellbasierte MaskenfortschreibungJa (SAM 2, serverseitig)Über KI-AgentenÜber ML-BackendJaJaJaJa
Deep Zoom / GigapixelJa (DZI + IIIF)Teilweise--JaJa-
3D-Punktwolken und QuaderJaJa---JaJa
Punktwolken-Sequenzen-Ja---JaJa
Sensorfusion (2D↔3D)JaTeilweise---JaJa
Tiefenkarten mit FensterungJa---Teilweise--
DICOM / NIfTI / WSI----JaJa-
Modelltraining im selben Produkt-Teilweise-JaJaJa-
Import von CV-Formaten15 FormateUmfangreichTeilweiseUmfangreichTeilweiseUmfangreichTeilweise
Zufallskorrigierte Übereinstimmung über GeometrieJa------
Roboter-Episoden (LeRobot, RLDS, HDF5)Ja------
Evaluation generativer Videos und von WeltmodellenJa------
Evaluation von VLM-Verankerung und -ZeigenJa------

In den meisten Zeilen ziehen die ausgereiften CV-Plattformen mit Potato gleich oder liegen davor. Zwei Zeilen lohnen ein genaues Lesen statt eines bloßen Häkchens: Potatos Segmentierung per Textprompt läuft im Browser unter einem Apache-2.0-Modell, während die kommerziellen Entsprechungen serverseitig unter den nicht-kommerziellen Bedingungen von SAM 3 laufen, und seine Maskenfortschreibung läuft auf dem Server, die kostenlose Stufe bekommt die Fähigkeit also, aber nicht im Browser. In den letzten vier Zeilen macht Potato etwas, das die anderen Werkzeuge nicht anbieten.

Computer Vision in großem Volumen

CVAT ist das Referenzwerkzeug unter den quelloffenen CV-Werkzeugen und bleibt die bessere Wahl für reine CV-Pipelines mit hohem Volumen: tiefere Aufgaben- und Jobverwaltung, Attribute pro Objekt, ein größeres Format-Ökosystem über Datumaro und eine sehr große Community. Nimm Potato, wenn die CV-Arbeit neben Text-, Audio- oder Evaluationsaufgaben steht, oder wenn du Übereinstimmung zwischen Annotierenden brauchst statt Genauigkeit gegen einen Ground-Truth-Job.

Roboflow ist ausgezeichnet, wenn dein Ziel ein trainiertes Modell ist: Smart Polygon, automatisches Labeln im Batch, Label Assist aus deinem eigenen Modell sowie gehostetes Training und Deployment in einem Kreislauf. Potato trainiert keine Detektoren. Nimm Potato, wenn die Labels selbst das Forschungsergebnis sind und ihre Zuverlässigkeit belegbar sein muss.

Labelbox, SuperAnnotate, Encord, Kili und V7 sind ausgereifte kommerzielle Plattformen mit Belegschaftsverwaltung, Unternehmens-Governance und starkem modellgestütztem Labeln. Wenn du eine verwaltete Belegschaft, Compliance-Zertifizierungen oder Kuratierung im Petabyte-Bereich brauchst, sind sie die richtige Antwort.

X-AnyLabeling bündelt Grounding DINO, Grounded-SAM 2, SAM 2.1 und YOLO in einer Desktop-Anwendung, und für eine einzelne Person, die lokal mit einer breiten Modellauswahl labelt, ist das schwer zu schlagen. Potato bringt eine engere Modellauswahl mit und läuft im Browser, es wird also nichts auf dem Rechner der annotierenden Person installiert; sein Vorteil beginnt, sobald mehr als eine Person annotiert.

Gigapixel und digitale Pathologie

Potato baut eine Kachelpyramide, die sowohl als DZI als auch über die IIIF Image API 3.0 ausgeliefert wird, und Pinselmasken arbeiten in der vollen Auflösung der Quelle, weil der Maskenpuffer Bildpixel indiziert und keine GPU-Textur.

Speziell für digitale Pathologie sind QuPath (Desktop, quelloffen, der Standard des Felds) und Cytomine (Web, quelloffen, mehrbenutzerfähig mit blinder Annotation) eigens gebaut, und Potato liest weder SVS noch DICOM oder NIfTI. Nimm Potato hier, wenn deine Bilder groß sind, aber nicht in klinischen Formaten vorliegen, oder wenn du seine Übereinstimmungs- und Workflow-Ebenen obendrauf brauchst.

3D und Sensorfusion

Segments.ai, Kognic, Deepen AI, Supervisely und Xtreme1/BasicAI sind Spezialisten, und für produktive Pipelines im autonomen Fahren liegen sie vorn: Sequenz- und Episoden-Workflows mit Track-Fortschreibung, Radar- und Multi-LiDAR-Unterstützung, Modelle zum automatischen Einpassen von Quadern, Attribut-Ontologien pro Objekt und im Fall von Deepen ein vollständiges Produkt zur zielmarkenfreien Kalibrierung. Supervisely und Xtreme1 lassen sich beide selbst hosten, und Supervisely verarbeitet deutlich größere Punktwolken.

Nimm Potato für 3D, wenn du Zuverlässigkeitsstatistiken über räumliche Labels willst, oder wenn 3D ein Teil einer multimodalen Studie ist.

Robotik, Weltmodelle und Verankerung

Für Roboter-Episoden ist ATLAS (TU Wien) ein spezialisiertes Desktop-Werkzeug für die Segmentierung von Handlungen über lange Zeiträume, mit nativer Unterstützung für ROS bag und RLDS, und für Grenzgenauigkeit bei einer einzelnen annotierenden Person eigens gebaut. ELAN und BORIS bleiben die Standards für die Verhaltenskodierung, und Rerun und Foxglove sind die besten Visualisierungswerkzeuge in der Robotik.

Bei generativem Video besteht das Ökosystem vor allem aus Benchmarks (VBench, WorldModelBench, Physics-IQ) plus Crowd-Panels für die Erhebung von Präferenzen im großen Maßstab. Diese liefern die Maße und die Referenzprotokolle; Potato liefert ein Instrument, um den menschlichen Teil wiederholt und mit gemessener Zuverlässigkeit durchzuführen, was sich ergänzt statt zu konkurrieren.

Bei der VLM-Verankerung prägen Datensätze und Auswertungsgerüste das Feld (RefCOCO, PixMo-Points, PointBench, lmms-eval, VLMEvalKit) und nicht Annotationsprodukte. Potatos Rolle ist es, die menschliche Referenz zu erheben und zu messen, auf der diese Benchmarks aufbauen.

Was Potato nicht kann

Damit eine Evaluation das nicht erst spät herausfindet:

  • Kein Modelltraining. Potato ordnet Elemente, labelt mit vorhandenen Modellen vor und kritisiert Annotationen mit einem VLM. Es trainiert und betreibt keine Detektoren. Roboflow, V7, Supervisely und Labelbox schon.
  • Noch keine Attribute pro Objekt. Geometrie trägt ein Label; Verdeckungsgrade, Abschneide-Kennzeichen und Untertyp-Attribute brauchen ein begleitendes Schema.
  • Kein Sequenzmodus für Punktwolken. 3D-Annotation läuft pro Frame; Track-Fortschreibung über einen Sweep hinweg ist nicht umgesetzt.
  • Kein DICOM, NIfTI oder WSI. Deep Zoom und 16-Bit-Fensterung decken große wissenschaftliche Bilder ab, keine klinischen.
  • Keine verwaltete Belegschaft, kein SAML/SCIM, keine Compliance-Zertifizierungen. Potato ist Software, die du selbst betreibst. RBAC und OAuth werden unterstützt, Unternehmens-Governance nicht.

Funktionszahlen

KategoriePotato
Annotationsschemata61
Anzeigetypen24
Exportformate29
Importformate15
Typen von KI-/LLM-Endpunkten13
Typen von Datenquellen8
Zuweisungsstrategien11
Umfrageinstrumente55
Crowdsourcing-Anbindungen9
Workflow-Phasen8

Die Zahlen werden aus Potatos eigenen Registries erzeugt. Eine Spalte „beste Alternative“ gibt es nicht, weil die Werkzeuge oben ihre Fähigkeiten unterschiedlich genug organisieren, dass eine einzelne Zahl zu einem irreführenden Vergleich einlädt.

Wie wähle ich ein Annotationswerkzeug aus?

  • Was annotierst du? Für reines Text-NER sind Doccano oder brat schlicht gehalten. Für gemischtes Text/Bild/Audio/Video decken Potato und Label Studio die Bandbreite ab.
  • Brauchst du Agenten- oder LLM-Evaluation? Hier fällt Potato aus dem Rahmen: Es liest Agenten-Traces in vielen Formaten und hat eigens gebaute Werkzeuge für die Evaluation von Trajektorien, Process Rewards, Web-Agenten, Coding-Agenten, Multi-Agenten-Teams und Computer-Use bzw. Multimodalem. Die meisten allgemeinen Werkzeuge haben das nicht.
  • Budget. Potato, Label Studio (Kern), Doccano, brat und Argilla sind kostenlos und quelloffen; Prodigy und einige Label-Studio-Stufen sind kostenpflichtig.
  • Einrichtungsaufwand. Potato wird über eine YAML-Datei konfiguriert und braucht keinen Code; Prodigy ist code-first; die anderen liegen dazwischen.
  • Ökosystem. Prodigy passt zu spaCy, Argilla zu Hugging Face; Potato exportiert in viele ML-Formate, darunter CoNLL, spaCy, Hugging Face und COCO/YOLO.

Wann ist Potato das richtige Annotationswerkzeug?

Potato stammt aus der akademischen NLP-Forschung. Das ursprüngliche System wurde auf der EMNLP 2022 vorgestellt und Potato 2.0 auf der ACL 2026, und es ist für den gesamten Forschungsablauf gebaut: viele Aufgabentypen, Qualitätskontrolle und Übereinstimmungsmaße von Haus aus, Anbindungen ans Crowdsourcing und ein umfangreiches Instrumentarium zur Evaluation von KI-Agenten. Wenn deine Arbeit mehrere Modalitäten umfasst oder die Evaluation von LLMs und Agenten einschließt, lohnt sich ein Blick.

Brauchst du hauptsächlich eine einzelne Textaufgabe mit einem gehosteten kommerziellen Produkt, oder lebst du ganz in spaCy oder Hugging Face, passt womöglich eines der anderen besser.

Häufige Fragen

Was ist das beste kostenlose Annotationswerkzeug?

Das hängt von der Modalität ab. Für reine Textklassifikation und NER sind Doccano und brat am schnellsten aufgesetzt. Für Text, Bild, Audio und Video in einem Projekt decken sowohl Potato als auch die Community Edition von Label Studio die Bandbreite ab; der Unterschied zeigt sich bei der Qualitätssicherung: Potato enthält Übereinstimmungsmetriken und Qualitäts-Dashboards kostenlos, Label Studio stellt sie in eine kostenpflichtige Stufe. Für Computer Vision in großem Volumen ist CVAT kostenlos und ausgereift.

Ist Potato eine kostenlose Alternative zu Label Studio?

Ja. Potato ist kostenlos und quelloffen und deckt Text, Bild, Audio, Video sowie Agenten- und LLM-Evaluation aus einer einzigen YAML-Konfiguration ohne Code ab. Label Studio ist bei manchen Integrationen breiter aufgestellt, drängt Teams aber zu kostenpflichtigen Stufen; Potato bleibt kostenlos und selbst gehostet, was zu akademischer und reproduzierbarer Forschungsarbeit passt.

Ist Potato eine kostenlose, quelloffene Alternative zu Prodigy?

Ja. Prodigy ist ein ausgezeichnetes kostenpflichtiges, code-first arbeitendes Werkzeug mit enger Bindung an spaCy; Potato ist kostenlos, wird in YAML ohne Code konfiguriert und exportiert in die Formate von spaCy, CoNLL und Hugging Face. Willst du Active Learning ohne kommerzielle Lizenz, ist Potato die quelloffene Option.

Wie schneidet Potato gegenüber INCEpTION bei linguistischer Annotation ab?

INCEpTION ist stark bei tiefgehender linguistischer Annotation und der Anbindung an Wissensbasen, aber schwerer aufzusetzen. Potato ist einfacher in Betrieb zu nehmen, eine YAML-Datei und ein Befehl, und meist schneller bei Span-, Relations- und Klassifikationsaufgaben, die INCEpTIONs volle linguistische Maschinerie nicht brauchen.

Warum Potato statt einer kommerziellen Plattform wie Labelbox oder Scale AI?

Labelbox und Scale verkaufen eine verwaltete Plattform samt Labeling-Belegschaft, was zu Unternehmen passt, die beides einkaufen. Für Forschungsteams, die ihre Annotierenden selbst mitbringen und deren Daten auf den eigenen Servern bleiben müssen, ist Potato die kostenlose, selbst gehostete Alternative, mit eingebauten Maßen für die Inter-Annotator-Übereinstimmung.

Was ist das beste Open-Source-Werkzeug zur Annotation von KI-Agenten-Trajektorien?

Hier fällt Potato unter den allgemeinen Annotationswerkzeugen aus dem Rahmen: Es liest Agenten-Traces in 15 Formaten und hat eigens gebaute Darstellungen für die Evaluation von Trajektorien, einzelnen Schritten, Web-Agenten und Coding-Agenten. Es annotiert außerdem Multi-Agenten-Teams auf einem anklickbaren Interaktionsgraphen und multimodale Agenten wie Computer-Use- und Sprachagenten. Die meisten Werkzeuge, ob quelloffen oder kommerziell, annotieren Agentenläufe gar nicht.

Was kann Potato evaluieren, das Observability-Werkzeuge und Labeling-Plattformen nicht können?

Zwei Bereiche der Agentenannotation, von denen keiner als konfigurierbare, selbst gehostete Funktion in den üblicherweise mit Potato verglichenen Werkzeugen auftaucht (LangSmith, Langfuse, Labelbox, Scale AI, Label Studio, Argilla, Braintrust), abgeglichen mit deren Dokumentation im Stand Juni 2026:

  • Struktur von Multi-Agenten-Teams. Ein von Annotierenden bearbeitbarer Interaktionsgraph (den kritischen Pfad markieren, eine schlechte Übergabe kennzeichnen), agentenübergreifende Fehlerzuschreibung als Tripel aus verantwortlichem Agenten, entscheidendem Schritt und Grund, Übergabeprüfung als eigenständiges Objekt, Scorecards pro Agent und pro Team, eine Zeitleiste für Werkzeugkonflikte und die Kennzeichnung emergenten Verhaltens. Am nächsten kommt dem anderswo Langfuses „Agent Graphs“, eine reine Debugging-Ansicht ohne Schreibzugriff und keine Annotationsoberfläche.
  • Multimodale Agenten. Computer-Use-Trajektorien mit einem Marker für die Klickverankerung, Sprach-Zeitleisten im Vollduplex samt Bewertung von Unterbrechungen und zeitliche Verankerung in Video mit laufend berechnetem IoU gegen das vom Modell vorhergesagte Intervall. Scale AI macht GUI-Verankerung und Sprachevaluation, aber als verwaltete Datensatz-Projekte, und seine Sprach-Arena arbeitet turnbasiert statt im Vollduplex.

Die Observability-Werkzeuge (LangSmith, Langfuse, Braintrust) hängen Bewertungen und Kommentare an einzelne Spans, was echte Annotation pro Schritt ist, aber nicht diese Oberflächen für Agentenstruktur. Die Labeling-Plattformen (Labelbox, Scale) bieten Datenprodukte zur Agentenevaluation an, aber als kostenpflichtige Cloud- oder verwaltete Dienste, nicht als Werkzeug, das du selbst hostest und in YAML konfigurierst. Die Fähigkeiten bewegen sich schnell, das hier gibt also den Stand von Juni 2026 wieder; der vollständige Vergleichsbeitrag nennt die geprüften Versionen.

Weiterführende Lektüre