Agreement Cannot Catch Rubber-Stamping
When annotators accept model pre-labels without reading them, inter-annotator agreement goes up. Every quality measure computed from the annotations improves. Timing is the only signal left.
Neuigkeiten, Anleitungen und Updates vom Potato-Team.
When annotators accept model pre-labels without reading them, inter-annotator agreement goes up. Every quality measure computed from the annotations improves. Timing is the only signal left.

Potato kann jetzt aufzeichnen, wie Annotatoren Freitextantworten erzeugen, ohne aufzuzeichnen, was sie tippen, und macht aus Pausen, Überarbeitungen und Einfügungen prüfbare Markierungen für Antworten, die eingefügt statt geschrieben wurden.
Ein vollständiger Durchgang vom Ordner mit Whisper-Ausgaben bis zu gelabelten Sprecher-Turns: die Annotationseinheit wählen, die Diarisierung klären, die Konfiguration schreiben, die Aufgabe laufen lassen und mit intaktem Zeit-Alignment exportieren.



Get notified about new tutorials, releases, and community highlights.
Die Mehrheitsentscheidung wirft das meiste von dem weg, was die Annotatoren mitgeteilt haben. Die Item-Response-Theorie gibt jedem Label eine Posterior-Wahrscheinlichkeit und ein Konfidenzintervall, schätzt Annotator-Fähigkeit und Element-Schwierigkeit und findet kaputte Codebuch-Einträge, ganz ohne Gold-Labels und ohne LLM.
Potato 2.7 bringt Labels mit Fehlerbalken, Live-Norming-Räume, kontrafaktische Grenzsonden, Peer-Prediction-Bewertung, lokale gesprochene Begründungen, Datensatzberichte auf einen Befehl und mobile Annotation, und nichts davon braucht ein LLM. Dazu die Bewertung von Multi-Agenten-Teams und multimodalen Agenten.

Eine Anleitung zur menschlichen Bewertung von Computer-Use- und GUI-Agenten in Potato: jede Aktion beurteilen, das Klick-Grounding auf dem Screenshot prüfen und Tool-Aufrufe einzeln durchgehen.
So finden Sie mit Potato heraus, warum ein Multi-Agent-LLM-System gescheitert ist: der Interaktionsgraph, die Fehlerzuordnung, die Übergabeprüfung, Bewertungsbögen pro Agent, die Tool-Contention-Zeitleiste und das Tagging von emergentem Verhalten.

Menschliche Prüfzeit ist die knappste Ressource bei der Agenten-Evaluation. Potato 2.6 kombiniert eine signalbasierte Triage-Warteschlange mit Judge-Mensch-Abgleich, sodass die schlimmsten Traces zuerst zu Menschen gelangen und Ihr LLM-Judge immer besser wird.
Annotator identity shapes labels on subjective tasks, so demographics are worth collecting, but only with consent and a reason. What to ask, what to leave alone, and how to run the flow in Potato.



A practical guide to deciding when an LLM can annotate your data, where model annotators fail, and how to combine automation with human verification in Potato.
Ein ehrlicher Blick darauf, wie man ein quelloffenes Datenannotationswerkzeug auswählt, welche Fragen die Wahl tatsächlich eingrenzen und wo Potato unter Label Studio, Prodigy, Doccano, brat und Argilla einzuordnen ist.



Potato unterstützt jetzt die Annotation von Coding-Agenten mit Diff-Darstellung, Terminalausgabe und Process-Reward-Schemata. Traces aus Claude Code, Aider und SWE-Agent lassen sich direkt importieren.
Schritt-für-Schritt-Anleitung zum Sammeln von Reward-Signalen pro Schritt für das PRM-Training mit Potato. Behandelt den First-Error-Modus, die Annotation pro Schritt und den Export in Trainingspipelines.




Potato im Vergleich mit LangSmith, Langfuse, Labelbox und Scale AI für die Agent-Evaluation: Trace-Darstellung, Annotation pro Schritt und über mehrere Agenten hinweg, Review multimodaler Agenten, Coding-Agenten, Live-Beobachtung, Preise und Self-Hosting.
Mehrkriterien-Rubriken in Potato einrichten: eigene Kriterien, konfigurierbare Bewertungsskalen und Dimensionsgewichte für die systematische Evaluierung von KI-Agenten mit rubric_eval.


Wie man Potatos Web-Agent-Trace-Anzeige nutzt, um autonome Web-Browsing-Agenten mit schrittweisen Screenshots, SVG-Overlays und schrittweisen Annotationsschemata zu evaluieren.
Potato 2.2.0 ergänzt 9 neue Annotationsschemata, ein erweiterbares Exportsystem, Kompetenzschätzung mit MACE, 55 validierte Erhebungsinstrumente und entfernte Datenquellen.


Rechtsdokumente in Potato annotieren, also Verträge, Gerichtsakten und Regulierungstexte, mit Span-Labeling, Entitätsextraktion und selbst gehostetem Betrieb mit Datenschutz an erster Stelle.
Bewährte Vorgehensweisen für die Annotation medizinischer Bilder in Potato: DICOM-Anzeige, Labeln radiologischer Befunde, Erfassung unerwünschter Ereignisse und IRB-konformer selbst gehosteter Betrieb.




So baust du in Potato Aufgaben zum Bildvergleich nebeneinander: für Präferenz-Rankings, A/B-Tests und die Beurteilung visueller Qualität, mit zufälliger Reihenfolge und paarweiser Bewertung.
Potato 2.0 bringt KI-gestützte Vorannotation mit OpenAI und Claude, Multimedia-Unterstützung für Audio und Video, Active Learning, Bounding-Box-Annotation und eine überarbeitete Oberfläche.



So baust du in Potato eigene Annotationsoberflächen mit HTML-Templates, CSS und JavaScript: nebeneinander angeordnete Layouts, eigene Widgets und eingebettete Medien.
So baust du in Potato eine Aufgabe zur Bewertung der Aussprachequalität: Audiowiedergabe, Wellenformdarstellung, Likert-Skalen und Freitextfelder für Rückmeldungen pro Aufnahme.




Cohens Kappa, Fleiss' Kappa und Krippendorffs Alpha für Potato-Annotationsprojekte berechnen und deuten, mit Python-Codebeispielen und Hinweisen zur Interpretation.
Bewährtes Vorgehen, um die Qualität in Annotationsprojekten zu sichern, samt praktischer Strategien, die du in Potato und darüber hinaus umsetzen kannst.




Ein Überblick über die Grundbegriffe der Multi-Object-Tracking-Annotation und darüber, wie weit die Video-Funktionen von Potato einen einfachen Tracking-Ablauf tragen.
So baust du in Potato eine Aufgabe zur Emotionsklassifikation auf Audio: interaktive Wellenform, Steuerung der Abspielgeschwindigkeit, Likert-Skalen und frei wählbare Emotionslabelsätze.