Skip to content

Comparatif des outils d'évaluation d'agents IA : LangSmith, Langfuse, Phoenix et Potato

Compare LangSmith, Langfuse, Arize Phoenix, Braintrust, Opik, W&B Weave et Potato pour la revue humaine de traces d'agents : files d'annotation, étiquettes par étape, accord et auto-hébergement.

Les outils d'évaluation d'agents IA se répartissent en deux familles. Les plateformes d'observabilité, dont LangSmith, Langfuse, Arize Phoenix, Braintrust et Opik, tracent un agent en production et permettent aux relecteurs d'attacher des notes aux exécutions et aux spans. Les outils d'annotation comme Potato partent de l'étude humaine : plusieurs relecteurs par trace, des étiquettes sur chaque étape, et une mesure de l'accord entre relecteurs. Les deux fonctionnent ensemble. Continuez à tracer là où vous tracez déjà, exportez les exécutions à juger, et menez l'étude dans l'outil d'annotation.

Une trace d'agent, ou trajectoire, enregistre chaque étape de l'agent : son raisonnement, les outils qu'il a appelés et ce qu'ils ont renvoyé. L'évaluation humaine peut noter l'exécution entière, étiqueter chaque étape ou comparer deux exécutions côte à côte. Un LLM juge note les traces automatiquement, et il lui faut des étiquettes humaines pour être vérifié. Voir Évaluer des agents IA.

Cette page traite de l'évaluation d'agents et de LLM. Le comparatif des outils d'annotation par IA couvre tous les types de données sur une seule page.

Quels outils d'évaluation d'agents faut-il comparer ?

OutilConçu pourRevue humaine
LangSmithTracer et évaluer des applications LangChain et LangGraphFiles d'annotation avec retours sur grille, plusieurs relecteurs par exécution, files par paires
LangfuseTraçage, gestion de prompts et évaluation open sourceFiles d'annotation et configurations de notes catégorielles ou numériques
Arize PhoenixTraçage et évaluationConfigurations d'annotation pour des retours catégoriels, continus et libres, venant d'humains, de LLM ou de code
BraintrustÉvaluation et journalisationNotes de revue humaine : catégorielles, continues et libres
Comet OpikTraçage et évaluation open sourceFiles d'annotation partagées par lien avec des experts métier
W&B WeaveTraçage et évaluationScorers d'annotation humaine définis dans l'interface ou par API
Label StudioAnnotation généralisteImporte des traces LangGraph, CrewAI et AutoGen pour une revue étape par étape
PotatoÉtudes d'annotation humaineÉtiquettes par étape avec taxonomie d'erreurs, graphes multi-agents, comparaison par paires, accord entre relecteurs

Auto-hébergement et prix des outils de notre matrice de capacités :

Auto-hébergementPrix
LangSmithOffre Enterprise uniquement39 $ par poste et par mois
LangfuseGratuit (MIT)Gratuit en auto-hébergement
Comet OpikGratuit (Apache-2.0)Gratuit en auto-hébergement
GalileoContrat Enterprise100 $ par mois
PotatoGratuit (GPL-3.0)Gratuit

Ce que chaque plateforme fait des notes humaines

Les files d'annotation de LangSmith prennent en charge des clés de retour sur grille, un nombre configurable de relecteurs par exécution, des files par paires et des relecteurs qui ne voient pas les retours des autres.

Langfuse définit les notes via des configurations de notes et achemine traces, observations et sessions vers les relecteurs via des files d'annotation. Sur son forum communautaire, des utilisateurs ont indiqué en novembre 2025 que deux personnes ne pouvaient toujours pas annoter la même trace de façon indépendante dans une file, et le contournement discuté est une configuration de note distincte pour chaque annotateur (discussion #4348). Langfuse peut calculer le κ de Cohen entre une note humaine et celle d'un LLM juge, deux séries à la fois.

Arize Phoenix donne une même structure aux annotations humaines, de LLM et de code, avec des configurations d'annotation qui gardent les étiquettes cohérentes d'une revue à l'autre. Les spans annotés peuvent être exportés vers un jeu de données pour des expériences ou pour construire un évaluateur aligné sur le jugement humain.

Braintrust attache des notes de revue humaine aux journaux et aux expériences. Sa documentation précise que masquer une note à certains relecteurs sert à désencombrer l'écran de revue et ne constitue pas un contrôle d'accès, puisque tout relecteur peut afficher toutes les notes.

Comet Opik place traces et fils dans des files d'annotation partageables par lien avec des experts métier, dans un écran de revue pensé pour des relecteurs non techniques.

W&B Weave enregistre les retours humains via des scorers d'annotation humaine, créés dans l'interface ou par API.

Dans la documentation d'annotation de LangSmith, Langfuse, Phoenix, Braintrust et Opik, nous n'avons trouvé aucune statistique d'accord entre relecteurs humains lors de nos vérifications d'août et septembre 2026. Chacune recueille les jugements humains sous forme de notes. Labelbox et Scale AI vendent des données d'évaluation d'agents en services gérés, ce qui est un autre achat : ils fournissent aussi les relecteurs.

Ce qui distingue Potato

  • Des traces issues de nombreux frameworks. Les convertisseurs lisent 15 formats : ReAct, OpenAI, Anthropic, LangChain (qui couvre les exports LangSmith), Langfuse, journaux multi-agents de CrewAI, AutoGen et LangGraph, SWE-bench, SWE-Agent, Claude Code, Aider, WebArena, Mind2Web et autres enregistrements de navigateur, MCP, OpenTelemetry et ATIF.
  • Des étiquettes sur chaque étape. Le schéma trajectory_eval enregistre si chaque étape était correcte, un type d'erreur issu d'une taxonomie hiérarchique, une gravité et un score cumulé. Ces mêmes étiquettes servent de données d'entraînement aux modèles de récompense de processus.
  • La structure multi-agents. Les relecteurs modifient un graphe d'interactions, marquent le chemin critique, attribuent un échec à un agent et à une étape, et examinent les passages de relais. La vue Agent Graphs de Langfuse affiche une exécution multi-agents sous forme de graphe pour le débogage, mais les relecteurs ne peuvent pas l'annoter. Voir Évaluer des systèmes multi-agents.
  • L'accord entre relecteurs. Chaque trace peut aller à plusieurs relecteurs qui ne voient pas les étiquettes des autres, et l'accord inter-annotateurs est rapporté. La calibration du juge compare un LLM juge à des étiquettes humaines en aveugle. Voir Mesurer l'accord entre un juge LLM et des annotateurs humains.
  • Agents de code et d'usage informatique. Diffs unifiés avec coloration syntaxique, sortie de terminal et commentaires de revue ancrés aux lignes. Les exécutions d'usage informatique montrent des captures d'écran avec la localisation des clics. Voir Évaluer des agents de code et Évaluer des agents d'usage informatique.

Faire entrer des traces dans Potato

Exportez depuis votre outil d'observabilité les exécutions à relire, puis convertissez-les :

bash
python -m potato.trace_converter \
  --input langfuse_traces.json \
  --output data/traces.jsonl \
  --input-format langfuse

Les exports d'exécutions LangSmith utilisent --input-format langchain. Si un framework ne figure pas dans la liste, --auto-detect choisit un convertisseur d'après les noms de champs.

Une tâche de revue étape par étape dans Potato

yaml
annotation_schemes:
  - annotation_type: trajectory_eval
    name: step_evaluation
    description: "Evaluate each step for correctness and mark any errors."
    steps_key: steps
    error_types:
      - {name: reasoning, subtypes: [logical_error, factual_error, planning_error]}
      - {name: execution, subtypes: [wrong_tool, wrong_args, api_error]}
    severities:
      - {name: minor, weight: -1}
      - {name: major, weight: -5}
    show_score: true

Voir Annoter des trajectoires d'agents pour concevoir la taxonomie d'erreurs.

Ce que Potato ne fait pas pour les agents

  • Ce n'est pas un service de supervision de production. Il dispose d'un SDK de traçage avec export OpenTelemetry, mais pas de cloud hébergé ni de tableaux de bord conçus pour la latence et le coût du trafic de production. Il est uniquement auto-hébergé.
  • Il ne fournit pas de relecteurs. Amenez les vôtres, ou recrutez-les sur Prolific.

Questions fréquentes

Quelle différence entre LangSmith et Langfuse pour la revue humaine ?

Tous deux attachent des notes humaines aux traces et aux spans via des files d'annotation. LangSmith est propriétaire, s'auto-héberge avec son offre Enterprise, et prend en charge plusieurs relecteurs par exécution et des files par paires. Langfuse est sous licence MIT et s'auto-héberge gratuitement ; sur son forum, des utilisateurs indiquent que deux personnes ne peuvent pas encore noter la même trace de façon indépendante dans une file. Aucun des deux ne documente de statistique d'accord entre relecteurs humains.

Existe-t-il une alternative open source à LangSmith pour évaluer des agents ?

Pour le traçage et la notation, Langfuse (MIT) et Comet Opik (Apache-2.0) sont open source et gratuits en auto-hébergement. Pour les études d'évaluation humaine, avec plusieurs relecteurs par trace, des étiquettes par étape et l'accord, Potato est open source et gratuit. Potato lit les exports de LangSmith et de Langfuse, et peut donc fonctionner à côté de l'un comme de l'autre.

Comment mesurer l'accord entre relecteurs humains de traces d'agents ?

Confiez chaque trace à au moins deux relecteurs qui ne voient pas les étiquettes des autres, puis calculez le κ de Cohen pour deux relecteurs ou l'α de Krippendorff au-delà, question par question. Les étiquettes par étape demandent d'abord d'apparier les étapes. L'accord inter-annotateurs expliqué traite du choix du coefficient.

Peut-on utiliser Potato avec des traces de LangSmith ou de Langfuse ?

Oui. python -m potato.trace_converter convertit les exports d'exécutions LangSmith avec --input-format langchain et ceux de Langfuse avec --input-format langfuse. Gardez le traçage de production là où il est, et faites entrer dans Potato les traces à juger.

Pour aller plus loin