Skip to content
Kostenlos & Open Source

Warum Potato wählen?

Potato ist kostenlos und läuft auf Ihrer eigenen Hardware. So schlägt es sich gegen zehn andere führende Werkzeuge.

Warum Potato wählen?

Wie Potato abschneidet

Elf Werkzeuge, geprüft anhand ihrer eigenen Dokumentation. Die meisten können einen Teil davon. Die Frage ist, was man dafür zahlt und was für kein Geld zu haben ist.

Enthalten, kostenlosNur im BezahltarifTeilweise, siehe HinweiseNicht vorhanden
AnnotationswerkzeugeVision und EnterpriseAgentenauswertung
FunktionPotatoGPL-3.0Label StudioApache-2.0ProdigyProprietaryArgillaApache-2.0CVATMITEncordProprietaryLabelboxProprietaryLangSmithProprietaryLangfuseMITComet OpikApache-2.0GalileoProprietary
Was es kostetFreeFree; $99/mo hosted; agreement is Enterprise$390, or $490/seat (5 min.)FreeFree; $33/user/mo hostedNot publishedUsage-based credits$39/seat/moFree self-hostedFree self-hosted$100/mo
Selbst gehostet, kostenlos*Enthalten, kostenlosEnthalten, kostenlosNur im BezahltarifEnthalten, kostenlosEnthalten, kostenlosNur im BezahltarifNur im BezahltarifNur im BezahltarifEnthalten, kostenlosEnthalten, kostenlosNur im Bezahltarif
Alle Funktionen, kein Bezahltarif*Enthalten, kostenlosNicht vorhandenNicht vorhandenEnthalten, kostenlosNicht vorhandenNicht vorhandenNicht vorhandenNicht vorhandenEnthalten, kostenlosEnthalten, kostenlosNicht vorhanden
Ein Werkzeug für Korpora und Agenten-Traces*Enthalten, kostenlosNur im BezahltarifNicht vorhandenNicht vorhandenNicht vorhandenNicht vorhandenNur im BezahltarifNicht vorhandenNicht vorhandenNicht vorhandenNicht vorhanden
Annotation von Agenten-TracesEnthalten, kostenlosNur im BezahltarifNicht vorhandenNicht vorhandenNicht vorhandenNicht vorhandenNur im BezahltarifEnthalten, kostenlosEnthalten, kostenlosEnthalten, kostenlosEnthalten, kostenlos
Multiagenten-Graph, den man annotieren kann*Enthalten, kostenlosNicht vorhandenNicht vorhandenNicht vorhandenNicht vorhandenNicht vorhandenNicht vorhandenTeilweise, siehe HinweiseTeilweise, siehe HinweiseTeilweise, siehe HinweiseTeilweise, siehe Hinweise
Von Menschen annotierte Fehlerzuordnung*Enthalten, kostenlosNicht vorhandenNicht vorhandenNicht vorhandenNicht vorhandenNicht vorhandenTeilweise, siehe HinweiseNicht vorhandenNicht vorhandenNicht vorhandenTeilweise, siehe Hinweise
LLM-Judge an menschlichen Labels gemessenEnthalten, kostenlosNur im BezahltarifNicht vorhandenNicht vorhandenNicht vorhandenNicht vorhandenNicht vorhandenEnthalten, kostenlosEnthalten, kostenlosNicht vorhandenEnthalten, kostenlos
Kalibrierungsfehler und Bias-Prüfung des JudgeEnthalten, kostenlosNicht vorhandenNicht vorhandenNicht vorhandenNicht vorhandenNicht vorhandenNicht vorhandenNicht vorhandenNicht vorhandenNicht vorhandenNicht vorhanden
Zufallskorrigierte Übereinstimmung (κ, α)*Enthalten, kostenlosNicht vorhandenNur im BezahltarifNicht vorhandenNicht vorhandenNicht vorhandenNicht vorhandenNicht vorhandenTeilweise, siehe HinweiseNicht vorhandenNicht vorhanden
Modellierung der Annotatorfähigkeit (IRT)Enthalten, kostenlosNicht vorhandenNicht vorhandenNicht vorhandenNicht vorhandenNicht vorhandenNicht vorhandenNicht vorhandenNicht vorhandenNicht vorhandenNicht vorhanden
Konfidenzintervall für jedes LabelEnthalten, kostenlosNicht vorhandenNicht vorhandenNicht vorhandenNicht vorhandenNicht vorhandenNicht vorhandenNicht vorhandenNicht vorhandenNicht vorhandenNicht vorhanden
Goldstandards und AufmerksamkeitstestsEnthalten, kostenlosNur im BezahltarifNicht vorhandenNicht vorhandenEnthalten, kostenlosNur im BezahltarifEnthalten, kostenlosNicht vorhandenNicht vorhandenNicht vorhandenNicht vorhanden
Live-Abstimmungsrunden mit ÜbereinstimmungsanzeigeEnthalten, kostenlosNicht vorhandenNicht vorhandenNicht vorhandenNicht vorhandenNicht vorhandenNicht vorhandenNicht vorhandenNicht vorhandenNicht vorhandenNicht vorhanden
Peer-Prediction-Bewertung, ohne GoldlabelsEnthalten, kostenlosNicht vorhandenNicht vorhandenNicht vorhandenNicht vorhandenNicht vorhandenNicht vorhandenNicht vorhandenNicht vorhandenNicht vorhandenNicht vorhanden
Export für SFT, DPO und Process Reward*Enthalten, kostenlosNicht vorhandenNicht vorhandenTeilweise, siehe HinweiseNicht vorhandenNur im BezahltarifNur im BezahltarifTeilweise, siehe HinweiseTeilweise, siehe HinweiseNicht vorhandenNicht vorhanden
Zufallskorrigierte Übereinstimmung über Geometrie*Enthalten, kostenlosNicht vorhandenNicht vorhandenNicht vorhandenNicht vorhandenNicht vorhandenNicht vorhandenNicht vorhandenNicht vorhandenNicht vorhandenNicht vorhanden
Übereinstimmung darüber, wann ein Ereignis eintritt*Enthalten, kostenlosNicht vorhandenNicht vorhandenNicht vorhandenNicht vorhandenNicht vorhandenNicht vorhandenNicht vorhandenNicht vorhandenNicht vorhandenNicht vorhanden
Zeichentelemetrie (Annahmelatenz, Korrekturen)*Enthalten, kostenlosNicht vorhandenNicht vorhandenNicht vorhandenNicht vorhandenNicht vorhandenNicht vorhandenNicht vorhandenNicht vorhandenNicht vorhandenNicht vorhanden
3D-Punktwolken und Quader*Enthalten, kostenlosNicht vorhandenNicht vorhandenNicht vorhandenEnthalten, kostenlosNur im BezahltarifNur im BezahltarifNicht vorhandenNicht vorhandenNicht vorhandenNicht vorhanden
Läuft ohne ausgehende Anfragen*Enthalten, kostenlosTeilweise, siehe HinweiseEnthalten, kostenlosTeilweise, siehe HinweiseEnthalten, kostenlosNicht vorhandenNur im BezahltarifNicht vorhandenTeilweise, siehe HinweiseTeilweise, siehe HinweiseNicht vorhanden
Betreute Annotator-Belegschaft*Nicht vorhandenNicht vorhandenNicht vorhandenNicht vorhandenNur im BezahltarifNur im BezahltarifNur im BezahltarifNicht vorhandenNicht vorhandenNicht vorhandenNicht vorhanden
Gehostet, nichts zu betreiben*Nicht vorhandenNur im BezahltarifNur im BezahltarifEnthalten, kostenlosEnthalten, kostenlosNur im BezahltarifNur im BezahltarifEnthalten, kostenlosEnthalten, kostenlosEnthalten, kostenlosEnthalten, kostenlos

Selbst gehostet, kostenlos: LangSmith, Galileo, Encord und Labelbox setzen für das Selbst-Hosting selbst einen Enterprise-Vertrag voraus. Der Betrieb im eigenen Rechenzentrum ist ein Zusatz, den man mit dem Vertrieb aushandelt, keine Edition zum Herunterladen.

Alle Funktionen, kein Bezahltarif: Die kostenlose Edition von Label Studio enthält überhaupt keine Übereinstimmungsmaße, und der gehostete Starter-Tarif für 99 $ im Monat ebenso wenig. Übereinstimmung, Benchmarks und LLM-Vorannotation sind Enterprise-Funktionen, deren Preis man erfragen muss. CVAT gibt Honeypots und Ground-Truth-Jobs kostenlos ab, behält die Qualitätsberichte aber zahlenden Teams vor.

Ein Werkzeug für Korpora und Agenten-Traces: Alle Plattformen zur Agentenauswertung hier sind auf Traces festgelegt. Keine kann ein Textkorpus nach Stimmung annotieren, eine Entität markieren oder eine Umfrage durchführen.

Multiagenten-Graph, den man annotieren kann: Mehrere Werkzeuge zeichnen einen Interaktionsgraphen. Alle sind reine Debugging-Ansichten zum Lesen. In Potato sind die Agenten und ihre Übergaben Objekte, die ein Mensch beschriftet.

Von Menschen annotierte Fehlerzuordnung: Galileo schließt Übergabefehler mit einem LLM, und Labelbox bewertet Schritte der Trajektorie. Keiner von beiden erhebt die menschliche Referenz, an der solche Schlüsse zu prüfen wären.

Zufallskorrigierte Übereinstimmung (κ, α): Die anderen messen Übereinstimmung als prozentuale Überlappung, IoU oder Mehrheitsentscheid. Prodigy liefert zwar Krippendorffs α und Gwets AC2, hat aber keinen kostenlosen Tarif. Langfuse berechnet Cohens κ zwischen einem Menschen und einem Judge, nicht über eine Gruppe von Annotatoren.

Export für SFT, DPO und Process Reward: Teilweise heißt: nur JSONL im SFT-Stil, ohne Format für Präferenzpaare oder Process Reward.

Zufallskorrigierte Übereinstimmung über Geometrie: Die stärkste einzelne Aussage in dieser Tabelle. CVATs Konsens-Engine und V7s Konsens-Stufe vergleichen Annotierende mit rohem IoU gegen einen Schwellenwert pro Klasse, und die Metrikliste von Label Studio Enterprise umfasst exakte Übereinstimmung, numerische Differenz, IoU und Span-Überlappung. Keines davon korrigiert den Zufall, und das zählt: Auf einem Korpus großer, mittig platzierter Objekte liegt der mittlere IoU bei etwa 0,95, egal wer annotiert hat.

Übereinstimmung darüber, wann ein Ereignis eintritt: Zeitliches IoU und Grenzübereinstimmung, wobei die Matching-Toleranz als Sweep statt bei einem einzelnen Schwellenwert berichtet wird. Übereinstimmung bei 0,25 s und bei 2 s sind unterschiedliche Aussagen über dieselben Daten.

Zeichentelemetrie (Annahmelatenz, Korrekturen): Zeit pro Form, Strichdynamik, Anzahl der Korrekturen und die Latenz beim Annehmen eines KI-Vorschlags. Das ist wichtig, weil die Übereinstimmung steigt, wenn Annotierende Vorannotationen ungeprüft übernehmen — die Zeit ist dann das einzige Signal, das Prüfen von Durchwinken trennt. Es werden keinerlei Koordinaten aufgezeichnet.

3D-Punktwolken und Quader: CVAT kann das ebenfalls, und die 3D-Spezialisten (Segments.ai, Kognic, Supervisely) gehen weiter, mit Punktwolken-Sequenzen und Track-Propagation, die Potato nicht hat. Potatos Beitrag ist das exakte rotierte 3D-IoU zwischen Annotierenden.

Läuft ohne ausgehende Anfragen: Jedes Stylesheet, Skript, jede Schrift und jedes Icon wird aus der Installation ausgeliefert, über alle 14 Templates hinweg, live geprüft mit 62 Anfragen und null externen. Modelle werden einmalig übertragen. „Teilweise“ heißt selbst hostbar, aber die gerenderte Seite lädt weiterhin Ressourcen von Dritten.

Betreute Annotator-Belegschaft: Haben wir nicht. Sie bringen Ihre eigenen Annotatoren mit oder rekrutieren über Prolific. Wer bis nächsten Monat 50.000 Elemente annotiert braucht und niemanden dafür hat, bekommt das bei Labelbox, Encord und Scale, nicht bei uns.

Gehostet, nichts zu betreiben: Potato läuft nur selbst gehostet. Für manche Teams ist genau das der Sinn der Sache, für andere ein echter Aufwand.

Anhand öffentlicher Dokumentation geprüft, August 2026. Die Anbieter sind schnell, und wir lassen uns lieber korrigieren, als falschzuliegen. Sagen Sie uns Bescheid, wenn ein Feld veraltet ist.

Sieben Gründe für Potato

100% Kostenlos

Keine Preisstaffeln, keine Nutzungslimits, keine Kreditkarte erforderlich. Potato ist kostenlos für Forschung, Bildung und nicht-kommerzielle Nutzung.

Messen Sie das Labeln, nicht nur die Labels

Die meisten Tools halten fest, was ein Annotator entschieden hat. Potato misst, wie er es entschieden hat: Fähigkeit und Item-Schwierigkeit live geschätzt, Entscheidungsgrenzen kontrafaktisch geprüft, Denken laut aufgezeichnet und Kalibrierung bewertet, ohne ein einziges Gold-Label.

Open Source

Vollständiger Zugriff auf den Quellcode. Anpassen, erweitern und beitragen. Kein Vendor-Lock-in, niemals.

Datenschutz an erster Stelle

Selbst gehostet auf Ihrer Infrastruktur. Ihre Daten verlassen niemals Ihre Server. Ideal für sensible Forschungsdaten.

Forschungsbasiert

Entwickelt an der University of Michigan. Veröffentlicht auf der ACL 2026 und EMNLP 2022, mit einem Best Demo Award auf der HCOMP 2024.

Keine Programmierung erforderlich

Konfigurieren Sie alles mit einfachen YAML-Dateien. Kein Programmieren erforderlich, um ausgefeilte Annotationsoberflächen zu erstellen.

Agentenbewertung

Die breiteste Unterstützung für Agenten-Annotation von allen Werkzeugen: 15 Trace-Formate, Multiagenten-Läufe auf einem Interaktionsgraphen, den man beschriften kann, Schemata für Computernutzung, Sprache und Video, Diffs von Coding-Agenten, Process-Reward-Annotation und Live-Beobachtung mit Rücksprung.

Für wen eignet sich Potato?

Akademische Forschende

Benötigen zitierfähige, kostenlose Werkzeuge für Publikationen und Förderanträge

Startups & kleine Teams

Können keine 10.000 €/Monat für Annotationswerkzeuge rechtfertigen

Datenschutzkritische Projekte

IRB-Anforderungen, Gesundheitswesen oder vertrauliche Daten

Lehrende & Studierende

NLP/ML-Kurse mit praktischer Annotation unterrichten

Bereit, Potato auszuprobieren?

In wenigen Minuten loslegen mit einem einfachen pip install. Keine Registrierung, keine Kreditkarte, keine Verpflichtungen.