Annotieren von Agenten-Trajektorien
Wie man KI-Agenten-Trajektorien Schritt für Schritt annotiert: Fehlertaxonomien, Bewertung des Schweregrads und Erfolg auf Trajektorienebene mit der Trajektorien-Evaluation von Potato.
Eine Trajektorie ist die vollständige Abfolge der Schritte, die ein Agent unternommen hat, seine Gedanken, Tool-Aufrufe und Beobachtungen. Eine Trajektorie zu annotieren heißt, den Lauf als Ganzes zu beurteilen und zu markieren, wo einzelne Schritte schiefgingen, jeweils mit einer Kategorie und einem Schweregrad. Potato annotiert Agenten-Trajektorien Schritt für Schritt mit eigenen Rubriken, kostenlos und selbst gehostet, und erzeugt so die Daten hinter Reward-Modellen und gezieltem Debugging.
Die Feature-Referenz steht unter Agentische Annotation.
Was erhebt man beim Annotieren einer Trajektorie?
- Gesamtergebnis: Erfolg, Teilerfolg oder Fehlschlag.
- Beurteilungen pro Schritt: War der jeweilige Schritt korrekt, unnötig oder falsch?
- Fehlerkategorien: warum ein Schritt falsch war (falsches Tool, schlechte Argumente, Halluzination, Schleifen, unsichere Aktion …).
- Schweregrad: wie gravierend der jeweilige Fehler war, oft gewichtet in einen Score.
Wie richte ich die Trajektorien-Evaluation in Potato ein?
Der Typ trajectory_eval von Potato stellt jeden Schritt als Karte dar und hängt eine Fehlertaxonomie pro Schritt mit Schweregrad-Gewichten an:
annotation_schemes:
- annotation_type: trajectory_eval
name: step_evaluation
description: "Evaluate each step for correctness and mark any errors."
steps_key: steps
error_types:
- {name: reasoning, subtypes: [logical_error, factual_error, planning_error]}
- {name: execution, subtypes: [wrong_tool, wrong_args, api_error]}
- {name: safety, subtypes: [harmful_action, data_leak, scope_violation]}
severities:
- {name: minor, weight: -1}
- {name: major, weight: -5}
- {name: critical, weight: -10}
show_score: trueDie Schweregrad-Gewichte summieren sich zu einem Trajektorien-Score, sodass du Läufe ordnen und Regressionen über Modellversionen hinweg verfolgen kannst.
Wie entwerfe ich eine Fehlertaxonomie für Agenten?
Die Taxonomie ist der Kern der Aufgabe. Halte sie klein, vollständig und überschneidungsfrei. Ein brauchbarer Anfang:
- Reasoning-Fehler: falsche Schlussfolgerung, ignorierte Evidenz, schlechter Plan.
- Ausführungsfehler: falsches Tool, fehlerhafter Aufruf, falsch verarbeitetes Ergebnis.
- Sicherheitsfehler: unsichere Aktion, Verhalten außerhalb des Rahmens, Datenpreisgabe.
Ergänze ein Freitextfeld „Sonstiges“, damit Annotierende neuartige Fehler nicht falsch einsortieren müssen, und mache wiederkehrende Notizen aus „Sonstiges“ dann zu benannten Kategorien.
Qualitätsaspekte
- Die Übereinstimmung bei der Schrittkorrektheit ist meist hoch, die bei der Fehlerkategorie niedriger. Miss beides, siehe Inter-Annotator-Übereinstimmung.
- Lange Trajektorien ermüden; begrenze die Länge oder blättere sie um.
- Der erste falsche Schritt ist fürs Training oft das Entscheidende, siehe Process Reward Models.
Weiterführende Lektüre
- Wie man verlässliche Labels für Agenten-Trajektorien bekommt, die ausführlichere Behandlung von Taxonomie-Design, Übereinstimmung auf Schrittebene und Adjudikation.
- Wie man KI-Agenten evaluiert
- Process Reward Models
- Evaluation von Tool-Nutzung