Werkzeuge zur Evaluation von KI-Agenten im Vergleich: LangSmith, Langfuse, Phoenix und Potato
Vergleich von LangSmith, Langfuse, Arize Phoenix, Braintrust, Opik, W&B Weave und Potato für die menschliche Prüfung von Agenten-Traces: Annotations-Warteschlangen, Labels pro Schritt, Übereinstimmung und Self-Hosting.
Werkzeuge zur Evaluation von KI-Agenten gibt es in zwei Arten. Observability-Plattformen wie LangSmith, Langfuse, Arize Phoenix, Braintrust und Opik zeichnen einen Agenten im Produktivbetrieb auf und lassen Prüfende Bewertungen an Runs und Spans hängen. Annotationswerkzeuge wie Potato gehen von der menschlichen Studie aus: mehrere Prüfende pro Trace, Labels für jeden Schritt und ein Maß dafür, wie gut die Prüfenden übereinstimmen. Beide arbeiten zusammen. Zeichnen Sie weiter dort auf, wo Sie es schon tun, exportieren Sie die Runs, die bewertet werden sollen, und führen Sie die Studie im Annotationswerkzeug durch.
Ein Agenten-Trace, auch Trajektorie genannt, hält jeden Schritt fest, den ein Agent gemacht hat: seine Überlegungen, die aufgerufenen Werkzeuge und deren Rückgaben. Menschliche Evaluation kann den ganzen Run bewerten, jeden Schritt labeln oder zwei Runs nebeneinander vergleichen. Ein LLM-as-a-Judge bewertet Traces automatisch und braucht menschliche Labels, an denen er überprüft wird. Siehe KI-Agenten evaluieren.
Diese Seite behandelt die Evaluation von Agenten und LLMs. KI-Annotationswerkzeuge im Vergleich behandelt alle Datentypen auf einer Seite.
Welche Werkzeuge zur Agenten-Evaluation lohnen einen Vergleich?
| Werkzeug | Gebaut für | Menschliche Prüfung |
|---|---|---|
| LangSmith | Aufzeichnung und Evaluation von LangChain- und LangGraph-Anwendungen | Annotations-Warteschlangen mit Rubrik-Feedback, mehrere Prüfende pro Run, paarweise Warteschlangen |
| Langfuse | Quelloffenes Tracing, Prompt-Verwaltung und Evaluation | Annotations-Warteschlangen und Score-Konfigurationen für kategoriale oder numerische Bewertungen |
| Arize Phoenix | Tracing und Evaluation | Annotationskonfigurationen für kategoriales, kontinuierliches und freies Feedback von Menschen, LLMs oder Code |
| Braintrust | Evaluation und Logging | Bewertungen aus menschlicher Prüfung: kategorial, kontinuierlich und frei |
| Comet Opik | Quelloffenes Tracing und Evaluation | Annotations-Warteschlangen, die per Link mit Fachleuten geteilt werden |
| W&B Weave | Tracing und Evaluation | Scorer für menschliche Annotation, angelegt in der Oberfläche oder über die API |
| Label Studio | Allgemeine Annotation | Importiert Traces aus LangGraph, CrewAI und AutoGen für die Prüfung pro Schritt |
| Potato | Menschliche Annotationsstudien | Labels pro Schritt mit Fehlertaxonomie, Multi-Agenten-Graphen, paarweiser Vergleich, Übereinstimmung zwischen Prüfenden |
Self-Hosting und Preise für die Werkzeuge in unserer Funktionsmatrix:
| Self-Hosting | Preis | |
|---|---|---|
| LangSmith | Nur im Enterprise-Tarif | 39 $ pro Platz und Monat |
| Langfuse | Kostenlos (MIT) | Selbst gehostet kostenlos |
| Comet Opik | Kostenlos (Apache-2.0) | Selbst gehostet kostenlos |
| Galileo | Enterprise-Vertrag | 100 $ im Monat |
| Potato | Kostenlos (GPL-3.0) | Kostenlos |
Was jede Plattform mit menschlichen Bewertungen macht
Die Annotations-Warteschlangen von LangSmith unterstützen Rubrik-Feedback-Schlüssel, eine einstellbare Zahl von Prüfenden pro Run, paarweise Warteschlangen und Prüfende, die das Feedback der anderen nicht sehen.
Langfuse definiert Bewertungen über Score-Konfigurationen und leitet Traces, Beobachtungen und Sitzungen über Annotations-Warteschlangen an Prüfende weiter. In seinem Community-Forum berichteten Nutzer im November 2025, dass zwei Personen denselben Trace in einer Warteschlange noch immer nicht unabhängig annotieren können; die dort diskutierte Umgehung ist eine eigene Score-Konfiguration für jede annotierende Person (Diskussion #4348). Langfuse kann Cohens κ zwischen einer menschlichen Bewertung und der Bewertung eines LLM-Judges berechnen, jeweils für zwei Reihen gleichzeitig.
Arize Phoenix gibt Annotationen von Menschen, LLMs und Code eine gemeinsame Struktur, mit Annotationskonfigurationen, die Labels über Prüfungen hinweg einheitlich halten. Annotierte Spans lassen sich in einen Datensatz exportieren, für Experimente oder um einen Evaluator zu bauen, der sich am menschlichen Urteil orientiert.
Braintrust hängt Bewertungen aus menschlicher Prüfung an Logs und Experimente. Seine Dokumentation weist darauf hin, dass das Ausblenden einer Bewertung für manche Prüfende die Prüfansicht entrümpelt und keine Zugriffskontrolle ist, da jede prüfende Person alle Bewertungen einblenden kann.
Comet Opik legt Traces und Threads in Annotations-Warteschlangen, die per Link mit Fachleuten geteilt werden können, in einer Prüfansicht für Personen ohne technischen Hintergrund.
W&B Weave erfasst menschliches Feedback über Scorer für menschliche Annotation, die in der Oberfläche oder über die API angelegt werden.
In der Annotationsdokumentation von LangSmith, Langfuse, Phoenix, Braintrust und Opik haben wir bei unserer Prüfung im August und September 2026 keine Statistik für die Übereinstimmung zwischen menschlichen Prüfenden gefunden. Jede sammelt menschliche Urteile als Bewertungen. Labelbox und Scale AI verkaufen Daten zur Agenten-Evaluation als verwaltete Dienstleistung, was ein anderer Kauf ist: Sie stellen auch die Prüfenden.
Wo sich Potato unterscheidet
- Traces aus vielen Frameworks. Konverter lesen 15 Formate: ReAct, OpenAI, Anthropic, LangChain (was LangSmith-Exporte abdeckt), Langfuse, Multi-Agenten-Logs aus CrewAI, AutoGen und LangGraph, SWE-bench, SWE-Agent, Claude Code, Aider, WebArena, Mind2Web und andere Browseraufzeichnungen, MCP, OpenTelemetry und ATIF.
- Labels für jeden Schritt. Das Schema
trajectory_evalhält fest, ob jeder Schritt korrekt war, dazu einen Fehlertyp aus einer hierarchischen Taxonomie, einen Schweregrad und einen laufenden Punktestand. Dieselben Labels sind die Trainingsdaten für Process-Reward-Modelle. - Struktur von Multi-Agenten-Systemen. Prüfende bearbeiten einen Interaktionsgraphen, markieren den kritischen Pfad, schreiben einen Fehler einem Agenten und einem Schritt zu und prüfen Übergaben. Die Ansicht Agent Graphs in Langfuse stellt einen Multi-Agenten-Run als Graph für das Debugging dar, aber Prüfende können ihn nicht annotieren. Siehe Multi-Agenten-Systeme evaluieren.
- Übereinstimmung zwischen Prüfenden. Jeder Trace kann an mehrere Prüfende gehen, die die Labels der anderen nicht sehen, und die Inter-Annotator-Übereinstimmung wird berichtet. Die Judge-Kalibrierung vergleicht einen LLM-Judge mit verblindeten menschlichen Labels. Siehe Übereinstimmung zwischen einem LLM-Judge und menschlichen Annotatoren messen.
- Coding- und Computer-Use-Agenten. Unified Diffs mit Syntaxhervorhebung, Terminalausgabe und an Zeilen verankerte Prüfkommentare. Computer-Use-Runs zeigen Screenshots mit der Verortung der Klicks. Siehe Coding-Agenten evaluieren und Computer-Use-Agenten evaluieren.
Traces in Potato übernehmen
Exportieren Sie die zu prüfenden Runs aus Ihrem Observability-Werkzeug und konvertieren Sie sie dann:
python -m potato.trace_converter \
--input langfuse_traces.json \
--output data/traces.jsonl \
--input-format langfuseRun-Exporte aus LangSmith verwenden --input-format langchain. Steht ein Framework nicht auf der Liste, wählt --auto-detect einen Konverter anhand der Feldnamen.
Eine Prüfaufgabe pro Schritt in Potato
annotation_schemes:
- annotation_type: trajectory_eval
name: step_evaluation
description: "Evaluate each step for correctness and mark any errors."
steps_key: steps
error_types:
- {name: reasoning, subtypes: [logical_error, factual_error, planning_error]}
- {name: execution, subtypes: [wrong_tool, wrong_args, api_error]}
severities:
- {name: minor, weight: -1}
- {name: major, weight: -5}
show_score: trueWie man die Fehlertaxonomie entwirft, steht in Agenten-Trajektorien annotieren.
Was Potato bei Agenten nicht kann
- Es ist kein Monitoring-Dienst für den Produktivbetrieb. Es hat ein Tracing-SDK mit OpenTelemetry-Export, aber keine gehostete Cloud und keine Dashboards für Latenz und Kosten über den Produktivverkehr hinweg. Es wird nur selbst gehostet.
- Es stellt keine Prüfenden. Bringen Sie Ihre eigenen mit oder rekrutieren Sie sie über Prolific.
Häufige Fragen
Was ist der Unterschied zwischen LangSmith und Langfuse bei der menschlichen Prüfung?
Beide hängen menschliche Bewertungen über Annotations-Warteschlangen an Traces und Spans. LangSmith ist proprietär, lässt sich im Enterprise-Tarif selbst hosten und unterstützt mehrere Prüfende pro Run sowie paarweise Warteschlangen. Langfuse steht unter MIT-Lizenz und lässt sich kostenlos selbst hosten; in seinem Forum berichten Nutzer, dass zwei Personen denselben Trace in einer Warteschlange noch nicht unabhängig bewerten können. Keines der beiden dokumentiert eine Statistik für die Übereinstimmung zwischen menschlichen Prüfenden.
Gibt es eine quelloffene Alternative zu LangSmith für die Agenten-Evaluation?
Für Tracing und Bewertung sind Langfuse (MIT) und Comet Opik (Apache-2.0) quelloffen und kostenlos selbst zu hosten. Für menschliche Evaluationsstudien mit mehreren Prüfenden pro Trace, Labels pro Schritt und Übereinstimmung ist Potato quelloffen und kostenlos. Potato liest Exporte aus LangSmith und Langfuse und kann daher neben beiden laufen.
Wie messe ich die Übereinstimmung zwischen menschlichen Prüfenden von Agenten-Traces?
Geben Sie jeden Trace an mindestens zwei Prüfende, die die Labels der anderen nicht sehen, und berechnen Sie dann pro Frage Cohens κ bei zwei Prüfenden oder Krippendorffs α bei mehr. Labels pro Schritt müssen zuerst Schritt für Schritt einander zugeordnet werden. Inter-Annotator-Übereinstimmung erklärt behandelt die Wahl des Koeffizienten.
Kann ich Potato mit Traces aus LangSmith oder Langfuse verwenden?
Ja. python -m potato.trace_converter konvertiert Run-Exporte aus LangSmith mit --input-format langchain und Exporte aus Langfuse mit --input-format langfuse. Behalten Sie das Tracing im Produktivbetrieb, wo es ist, und bringen Sie die Traces, die bewertet werden sollen, in Potato.
Weiterführende Lektüre
- KI-Annotationswerkzeuge im Vergleich, alle Datentypen auf einer Seite
- Potato vs. LangSmith und Langfuse für die Agenten-Evaluation
- Textannotationswerkzeuge im Vergleich
- Audioannotationswerkzeuge im Vergleich
- Bildannotationswerkzeuge im Vergleich
- Videoannotationswerkzeuge im Vergleich
- Werkzeuge zur Evaluation von Weltmodellen und Roboterepisoden im Vergleich