Wie man KI-Agenten evaluiert
Ein Überblick über die Evaluation von KI-Agenten und LLMs mit menschlicher Annotation: auf Ebene der Trajektorie, des Schritts, des Spans und des Vergleichs, und welches Potato-Werkzeug jeweils passt.
Einen KI-Agenten zu evaluieren heißt, nicht nur seine endgültige Antwort zu beurteilen, sondern den Weg dorthin: die Argumentation, die Tool-Aufrufe und die Aktionen unterwegs. Menschliche Annotation ist dafür weiterhin der Goldstandard, denn viele Fehler eines Agenten (ein plausibler, aber falscher Schritt, eine unsichere Aktion) fallen zuverlässig nur einem Menschen auf. Potato ist ein Open-Source-Werkzeug für die menschliche Annotation von LLM-Agenten-Trajektorien, mit einer eigens gebauten Darstellung für jede Evaluationsebene.
Ein KI-Agent ist hier ein LLM-gesteuertes System, das eine Aufgabe über mehrere Schritte löst, indem es Tools aufruft, im Web recherchiert oder Code schreibt. Siehe den Überblick zur Agenten-Evaluation und die Referenz zu agentischer Annotation.
Welche Ebenen der Agenten-Evaluation gibt es?
Nimm die Ebene, die zu deiner Frage passt:
- Ebene der Trajektorie: den ganzen Lauf beurteilen. Ist er geglückt? War er effizient und sicher? Siehe Annotieren von Agenten-Trajektorien.
- Ebene des Schritts: jede Aktion beurteilen. War dieser Tool-Aufruf richtig? War der Schritt nötig? Das sind die Daten hinter Process Reward Models.
- Ebene des Spans: konkrete Probleme innerhalb der Ausgaben markieren, etwa eine halluzinierte Behauptung oder eine unsichere Anweisung. Siehe Halluzinationen erkennen.
- Ebene des Vergleichs: zwei Agenten oder zwei Läufe direkt gegeneinander beurteilen. Siehe Paarweiser Modellvergleich.
- Ebene des Teams: bei Multi-Agenten-Systemen einen Fehlschlag dem verantwortlichen Agenten, Schritt und Übergabepunkt zuordnen. Siehe Wie man Multi-Agenten-Systeme evaluiert.
Welche Trace-Formate für Agenten unterstützt Potato?
Potato liest Agenten-Traces aus 15 Formaten, darunter Tool-Aufrufe von OpenAI und Anthropic, ReAct, LangChain, LangFuse, WebArena, SWE-bench, MCP und OpenTelemetry, und stellt sie in Ansichten dar, die auf die jeweilige Art von Agent zugeschnitten sind:
- Agenten-Trace-Anzeige für Traces mit Argumentation und Tool-Aufrufen.
- Web-Agenten-Anzeige mit Screenshots und eingeblendeten Aktionen, siehe Web-Agenten-Evaluation.
- Coding-Trace-Anzeige mit Diffs und Terminalausgabe, siehe Evaluation von Coding-Agenten.
- Live-Agenten-Anzeige, um einem Agenten in Echtzeit zuzusehen und ihn zu lenken, siehe Live Agent Evaluation.
- Multimodale Agenten-Anzeigen für Computer-Use-, Sprach- und Video-Agenten, siehe Evaluation von Computer-Use- und multimodalen Agenten.
Welche Methode der Agenten-Evaluation soll ich wählen?
| Deine Frage | Vorgehen |
|---|---|
| „Hat der Agent die Aufgabe erledigt?“ | Erfolgslabel für die Trajektorie |
| „Wo genau ist es schiefgegangen?“ | Fehlertaxonomie auf Schrittebene |
| „Welche Version ist besser?“ | Paarweiser Vergleich |
| „Wie gut ist er auf mehreren Achsen?“ | Rubric-Evaluation |
| „Ist die Antwort aus dem abgerufenen Kontext quellentreu?“ | RAG-Evaluierung |
| „Welcher Agent im Team hat den Fehlschlag verursacht?“ | Zuordnung im Multi-Agenten-System |
| „Hat der Computer-Use-Agent das Richtige angeklickt?“ | Durchsicht der GUI-Trajektorie |