Comparatif des outils d'évaluation d'agents IA : LangSmith, Langfuse, Phoenix et Potato
Compare LangSmith, Langfuse, Arize Phoenix, Braintrust, Opik, W&B Weave et Potato pour la revue humaine de traces d'agents : files d'annotation, étiquettes par étape, accord et auto-hébergement.
Les outils d'évaluation d'agents IA se répartissent en deux familles. Les plateformes d'observabilité, dont LangSmith, Langfuse, Arize Phoenix, Braintrust et Opik, tracent un agent en production et permettent aux relecteurs d'attacher des notes aux exécutions et aux spans. Les outils d'annotation comme Potato partent de l'étude humaine : plusieurs relecteurs par trace, des étiquettes sur chaque étape, et une mesure de l'accord entre relecteurs. Les deux fonctionnent ensemble. Continuez à tracer là où vous tracez déjà, exportez les exécutions à juger, et menez l'étude dans l'outil d'annotation.
Une trace d'agent, ou trajectoire, enregistre chaque étape de l'agent : son raisonnement, les outils qu'il a appelés et ce qu'ils ont renvoyé. L'évaluation humaine peut noter l'exécution entière, étiqueter chaque étape ou comparer deux exécutions côte à côte. Un LLM juge note les traces automatiquement, et il lui faut des étiquettes humaines pour être vérifié. Voir Évaluer des agents IA.
Cette page traite de l'évaluation d'agents et de LLM. Le comparatif des outils d'annotation par IA couvre tous les types de données sur une seule page.
Quels outils d'évaluation d'agents faut-il comparer ?
| Outil | Conçu pour | Revue humaine |
|---|---|---|
| LangSmith | Tracer et évaluer des applications LangChain et LangGraph | Files d'annotation avec retours sur grille, plusieurs relecteurs par exécution, files par paires |
| Langfuse | Traçage, gestion de prompts et évaluation open source | Files d'annotation et configurations de notes catégorielles ou numériques |
| Arize Phoenix | Traçage et évaluation | Configurations d'annotation pour des retours catégoriels, continus et libres, venant d'humains, de LLM ou de code |
| Braintrust | Évaluation et journalisation | Notes de revue humaine : catégorielles, continues et libres |
| Comet Opik | Traçage et évaluation open source | Files d'annotation partagées par lien avec des experts métier |
| W&B Weave | Traçage et évaluation | Scorers d'annotation humaine définis dans l'interface ou par API |
| Label Studio | Annotation généraliste | Importe des traces LangGraph, CrewAI et AutoGen pour une revue étape par étape |
| Potato | Études d'annotation humaine | Étiquettes par étape avec taxonomie d'erreurs, graphes multi-agents, comparaison par paires, accord entre relecteurs |
Auto-hébergement et prix des outils de notre matrice de capacités :
| Auto-hébergement | Prix | |
|---|---|---|
| LangSmith | Offre Enterprise uniquement | 39 $ par poste et par mois |
| Langfuse | Gratuit (MIT) | Gratuit en auto-hébergement |
| Comet Opik | Gratuit (Apache-2.0) | Gratuit en auto-hébergement |
| Galileo | Contrat Enterprise | 100 $ par mois |
| Potato | Gratuit (GPL-3.0) | Gratuit |
Ce que chaque plateforme fait des notes humaines
Les files d'annotation de LangSmith prennent en charge des clés de retour sur grille, un nombre configurable de relecteurs par exécution, des files par paires et des relecteurs qui ne voient pas les retours des autres.
Langfuse définit les notes via des configurations de notes et achemine traces, observations et sessions vers les relecteurs via des files d'annotation. Sur son forum communautaire, des utilisateurs ont indiqué en novembre 2025 que deux personnes ne pouvaient toujours pas annoter la même trace de façon indépendante dans une file, et le contournement discuté est une configuration de note distincte pour chaque annotateur (discussion #4348). Langfuse peut calculer le κ de Cohen entre une note humaine et celle d'un LLM juge, deux séries à la fois.
Arize Phoenix donne une même structure aux annotations humaines, de LLM et de code, avec des configurations d'annotation qui gardent les étiquettes cohérentes d'une revue à l'autre. Les spans annotés peuvent être exportés vers un jeu de données pour des expériences ou pour construire un évaluateur aligné sur le jugement humain.
Braintrust attache des notes de revue humaine aux journaux et aux expériences. Sa documentation précise que masquer une note à certains relecteurs sert à désencombrer l'écran de revue et ne constitue pas un contrôle d'accès, puisque tout relecteur peut afficher toutes les notes.
Comet Opik place traces et fils dans des files d'annotation partageables par lien avec des experts métier, dans un écran de revue pensé pour des relecteurs non techniques.
W&B Weave enregistre les retours humains via des scorers d'annotation humaine, créés dans l'interface ou par API.
Dans la documentation d'annotation de LangSmith, Langfuse, Phoenix, Braintrust et Opik, nous n'avons trouvé aucune statistique d'accord entre relecteurs humains lors de nos vérifications d'août et septembre 2026. Chacune recueille les jugements humains sous forme de notes. Labelbox et Scale AI vendent des données d'évaluation d'agents en services gérés, ce qui est un autre achat : ils fournissent aussi les relecteurs.
Ce qui distingue Potato
- Des traces issues de nombreux frameworks. Les convertisseurs lisent 15 formats : ReAct, OpenAI, Anthropic, LangChain (qui couvre les exports LangSmith), Langfuse, journaux multi-agents de CrewAI, AutoGen et LangGraph, SWE-bench, SWE-Agent, Claude Code, Aider, WebArena, Mind2Web et autres enregistrements de navigateur, MCP, OpenTelemetry et ATIF.
- Des étiquettes sur chaque étape. Le schéma
trajectory_evalenregistre si chaque étape était correcte, un type d'erreur issu d'une taxonomie hiérarchique, une gravité et un score cumulé. Ces mêmes étiquettes servent de données d'entraînement aux modèles de récompense de processus. - La structure multi-agents. Les relecteurs modifient un graphe d'interactions, marquent le chemin critique, attribuent un échec à un agent et à une étape, et examinent les passages de relais. La vue Agent Graphs de Langfuse affiche une exécution multi-agents sous forme de graphe pour le débogage, mais les relecteurs ne peuvent pas l'annoter. Voir Évaluer des systèmes multi-agents.
- L'accord entre relecteurs. Chaque trace peut aller à plusieurs relecteurs qui ne voient pas les étiquettes des autres, et l'accord inter-annotateurs est rapporté. La calibration du juge compare un LLM juge à des étiquettes humaines en aveugle. Voir Mesurer l'accord entre un juge LLM et des annotateurs humains.
- Agents de code et d'usage informatique. Diffs unifiés avec coloration syntaxique, sortie de terminal et commentaires de revue ancrés aux lignes. Les exécutions d'usage informatique montrent des captures d'écran avec la localisation des clics. Voir Évaluer des agents de code et Évaluer des agents d'usage informatique.
Faire entrer des traces dans Potato
Exportez depuis votre outil d'observabilité les exécutions à relire, puis convertissez-les :
python -m potato.trace_converter \
--input langfuse_traces.json \
--output data/traces.jsonl \
--input-format langfuseLes exports d'exécutions LangSmith utilisent --input-format langchain. Si un framework ne figure pas dans la liste, --auto-detect choisit un convertisseur d'après les noms de champs.
Une tâche de revue étape par étape dans Potato
annotation_schemes:
- annotation_type: trajectory_eval
name: step_evaluation
description: "Evaluate each step for correctness and mark any errors."
steps_key: steps
error_types:
- {name: reasoning, subtypes: [logical_error, factual_error, planning_error]}
- {name: execution, subtypes: [wrong_tool, wrong_args, api_error]}
severities:
- {name: minor, weight: -1}
- {name: major, weight: -5}
show_score: trueVoir Annoter des trajectoires d'agents pour concevoir la taxonomie d'erreurs.
Ce que Potato ne fait pas pour les agents
- Ce n'est pas un service de supervision de production. Il dispose d'un SDK de traçage avec export OpenTelemetry, mais pas de cloud hébergé ni de tableaux de bord conçus pour la latence et le coût du trafic de production. Il est uniquement auto-hébergé.
- Il ne fournit pas de relecteurs. Amenez les vôtres, ou recrutez-les sur Prolific.
Questions fréquentes
Quelle différence entre LangSmith et Langfuse pour la revue humaine ?
Tous deux attachent des notes humaines aux traces et aux spans via des files d'annotation. LangSmith est propriétaire, s'auto-héberge avec son offre Enterprise, et prend en charge plusieurs relecteurs par exécution et des files par paires. Langfuse est sous licence MIT et s'auto-héberge gratuitement ; sur son forum, des utilisateurs indiquent que deux personnes ne peuvent pas encore noter la même trace de façon indépendante dans une file. Aucun des deux ne documente de statistique d'accord entre relecteurs humains.
Existe-t-il une alternative open source à LangSmith pour évaluer des agents ?
Pour le traçage et la notation, Langfuse (MIT) et Comet Opik (Apache-2.0) sont open source et gratuits en auto-hébergement. Pour les études d'évaluation humaine, avec plusieurs relecteurs par trace, des étiquettes par étape et l'accord, Potato est open source et gratuit. Potato lit les exports de LangSmith et de Langfuse, et peut donc fonctionner à côté de l'un comme de l'autre.
Comment mesurer l'accord entre relecteurs humains de traces d'agents ?
Confiez chaque trace à au moins deux relecteurs qui ne voient pas les étiquettes des autres, puis calculez le κ de Cohen pour deux relecteurs ou l'α de Krippendorff au-delà, question par question. Les étiquettes par étape demandent d'abord d'apparier les étapes. L'accord inter-annotateurs expliqué traite du choix du coefficient.
Peut-on utiliser Potato avec des traces de LangSmith ou de Langfuse ?
Oui. python -m potato.trace_converter convertit les exports d'exécutions LangSmith avec --input-format langchain et ceux de Langfuse avec --input-format langfuse. Gardez le traçage de production là où il est, et faites entrer dans Potato les traces à juger.
Pour aller plus loin
- Comparatif des outils d'annotation par IA, tous les types de données sur une page
- Potato face à LangSmith et Langfuse pour l'évaluation d'agents
- Comparatif des outils d'annotation de texte
- Comparatif des outils d'annotation audio
- Comparatif des outils d'annotation d'images
- Comparatif des outils d'annotation vidéo
- Comparatif des outils d'évaluation des modèles du monde et des épisodes robotiques