Herramientas de evaluación de agentes de IA comparadas: LangSmith, Langfuse, Phoenix y Potato
Compara LangSmith, Langfuse, Arize Phoenix, Braintrust, Opik, W&B Weave y Potato para la revisión humana de trazas de agentes: colas de anotación, etiquetas por paso, acuerdo y autoalojamiento.
Las herramientas para evaluar agentes de IA son de dos tipos. Las plataformas de observabilidad, como LangSmith, Langfuse, Arize Phoenix, Braintrust y Opik, trazan un agente en producción y dejan que los revisores añadan puntuaciones a ejecuciones y spans. Las herramientas de anotación como Potato parten del estudio humano: varios revisores por traza, etiquetas en cada paso y una medida de cuánto coinciden los revisores. Las dos funcionan juntas. Sigue trazando donde ya trazas, exporta las ejecuciones que quieres juzgar y haz el estudio en la herramienta de anotación.
Una traza de agente, o trayectoria, registra cada paso que dio el agente: su razonamiento, las herramientas que llamó y lo que devolvieron. La evaluación humana puede puntuar la ejecución entera, etiquetar cada paso o comparar dos ejecuciones lado a lado. Un LLM como juez puntúa trazas automáticamente, y necesita etiquetas humanas con las que contrastarlo. Consulta Cómo evaluar agentes de IA.
Esta página trata la evaluación de agentes y de LLM. Herramientas de anotación con IA, comparadas cubre todos los tipos de datos en una sola página.
¿Qué herramientas de evaluación de agentes vale la pena comparar?
| Herramienta | Pensada para | Revisión humana |
|---|---|---|
| LangSmith | Trazar y evaluar aplicaciones de LangChain y LangGraph | Colas de anotación con feedback por rúbrica, varios revisores por ejecución, colas por pares |
| Langfuse | Trazado, gestión de prompts y evaluación de código abierto | Colas de anotación y configuraciones de puntuación categóricas o numéricas |
| Arize Phoenix | Trazado y evaluación | Configuraciones de anotación para feedback categórico, continuo y libre de personas, LLM o código |
| Braintrust | Evaluación y registro | Puntuaciones de revisión humana: categóricas, continuas y de texto libre |
| Comet Opik | Trazado y evaluación de código abierto | Colas de anotación compartidas con expertos en la materia mediante un enlace |
| W&B Weave | Trazado y evaluación | Scorers de anotación humana definidos en la interfaz o por API |
| Label Studio | Anotación general | Importa trazas de LangGraph, CrewAI y AutoGen para revisarlas paso a paso |
| Potato | Estudios de anotación humana | Etiquetas por paso con taxonomía de errores, grafos multiagente, comparación por pares, acuerdo entre revisores |
Autoalojamiento y precio de las herramientas de nuestra matriz de capacidades:
| Autoalojamiento | Precio | |
|---|---|---|
| LangSmith | Solo en el plan Enterprise | 39 $ por puesto al mes |
| Langfuse | Gratis (MIT) | Autoalojado gratis |
| Comet Opik | Gratis (Apache-2.0) | Autoalojado gratis |
| Galileo | Contrato Enterprise | 100 $ al mes |
| Potato | Gratis (GPL-3.0) | Gratis |
Qué hace cada plataforma con las puntuaciones humanas
Las colas de anotación de LangSmith admiten claves de feedback por rúbrica, un número configurable de revisores por ejecución, colas por pares y revisores que no ven el feedback de los demás.
Langfuse define las puntuaciones mediante configuraciones de puntuación y envía trazas, observaciones y sesiones a los revisores mediante colas de anotación. En su foro de la comunidad, varios usuarios indicaron en noviembre de 2025 que dos personas seguían sin poder anotar la misma traza de forma independiente en una cola, y la solución alternativa que se comenta allí es una configuración de puntuación distinta para cada anotador (discusión #4348). Langfuse puede calcular la κ de Cohen entre una puntuación humana y la de un juez LLM, de dos series en dos series.
Arize Phoenix da a las anotaciones de personas, LLM y código una misma estructura, con configuraciones de anotación que mantienen las etiquetas coherentes entre revisiones. Los spans anotados pueden exportarse a un dataset para experimentos o para construir un evaluador alineado con el juicio humano.
Braintrust añade puntuaciones de revisión humana a registros y experimentos. Su documentación advierte de que ocultar una puntuación a algunos revisores sirve para despejar la pantalla de revisión y no es un control de acceso, ya que cualquier revisor puede mostrar todas las puntuaciones.
Comet Opik coloca trazas e hilos en colas de anotación que pueden compartirse con expertos en la materia mediante un enlace, en una pantalla de revisión pensada para revisores sin perfil técnico.
W&B Weave registra el feedback humano mediante scorers de anotación humana, creados en la interfaz o por API.
En la documentación de anotación de LangSmith, Langfuse, Phoenix, Braintrust y Opik no encontramos ninguna estadística de acuerdo entre revisores humanos al revisarla en agosto y septiembre de 2026. Todas recogen los juicios humanos como puntuaciones. Labelbox y Scale AI venden datos de evaluación de agentes como servicios gestionados, que es otra compra: también aportan los revisores.
En qué se diferencia Potato
- Trazas de muchos frameworks. Los conversores leen 15 formatos: ReAct, OpenAI, Anthropic, LangChain (que cubre las exportaciones de LangSmith), Langfuse, registros multiagente de CrewAI, AutoGen y LangGraph, SWE-bench, SWE-Agent, Claude Code, Aider, WebArena, Mind2Web y otras grabaciones de navegador, MCP, OpenTelemetry y ATIF.
- Etiquetas en cada paso. El esquema
trajectory_evalregistra si cada paso fue correcto, un tipo de error de una taxonomía jerárquica, una gravedad y una puntuación acumulada. Esas mismas etiquetas son los datos de entrenamiento de los modelos de recompensa de procesos. - Estructura multiagente. Los revisores editan un grafo de interacción, marcan la ruta crítica, atribuyen un fallo a un agente y a un paso, y revisan los traspasos. La vista Agent Graphs de Langfuse muestra una ejecución multiagente como un grafo para depurar, pero los revisores no pueden anotarlo. Consulta Cómo evaluar sistemas multiagente.
- Acuerdo entre revisores. Cada traza puede ir a varios revisores que no ven las etiquetas de los demás, y se informa del acuerdo entre anotadores. La calibración del juez compara un juez LLM con etiquetas humanas a ciegas. Consulta Cómo medir el acuerdo entre un juez LLM y anotadores humanos.
- Agentes de código y de uso del ordenador. Diffs unificados con resaltado de sintaxis, salida de terminal y comentarios de revisión anclados a líneas. Las ejecuciones de uso del ordenador muestran capturas con la ubicación de los clics. Consulta Evaluación de agentes de código y Evaluación de agentes de uso del ordenador.
Llevar trazas a Potato
Exporta desde tu herramienta de observabilidad las ejecuciones que quieres revisar y conviértelas:
python -m potato.trace_converter \
--input langfuse_traces.json \
--output data/traces.jsonl \
--input-format langfuseLas exportaciones de ejecuciones de LangSmith usan --input-format langchain. Si un framework no está en la lista, --auto-detect elige un conversor a partir de los nombres de los campos.
Una tarea de revisión por pasos en Potato
annotation_schemes:
- annotation_type: trajectory_eval
name: step_evaluation
description: "Evaluate each step for correctness and mark any errors."
steps_key: steps
error_types:
- {name: reasoning, subtypes: [logical_error, factual_error, planning_error]}
- {name: execution, subtypes: [wrong_tool, wrong_args, api_error]}
severities:
- {name: minor, weight: -1}
- {name: major, weight: -5}
show_score: trueConsulta Anotar trayectorias de agentes para diseñar la taxonomía de errores.
Lo que Potato no hace con agentes
- No es un servicio de monitorización de producción. Tiene un SDK de trazado con exportación a OpenTelemetry, pero no una nube alojada ni paneles pensados para latencia y coste del tráfico de producción. Solo se autoaloja.
- No aporta revisores. Trae los tuyos o recútalos en Prolific.
Preguntas frecuentes
¿Qué diferencia hay entre LangSmith y Langfuse para la revisión humana?
Las dos añaden puntuaciones humanas a trazas y spans mediante colas de anotación. LangSmith es propietaria, puede autoalojarse en su plan Enterprise y admite varios revisores por ejecución y colas por pares. Langfuse tiene licencia MIT y se autoaloja gratis, y en su foro los usuarios indican que dos personas todavía no pueden puntuar la misma traza de forma independiente en una cola. Ninguna documenta una estadística de acuerdo entre revisores humanos.
¿Hay una alternativa de código abierto a LangSmith para evaluar agentes?
Para trazar y puntuar, Langfuse (MIT) y Comet Opik (Apache-2.0) son de código abierto y se autoalojan gratis. Para estudios de evaluación humana, con varios revisores por traza, etiquetas por paso y acuerdo, Potato es de código abierto y gratuito. Potato lee exportaciones de LangSmith y de Langfuse, así que puede funcionar junto a cualquiera de ellas.
¿Cómo mido el acuerdo entre revisores humanos de trazas de agentes?
Asigna cada traza al menos a dos revisores que no vean las etiquetas de los demás, y calcula la κ de Cohen para dos revisores o el α de Krippendorff para más, pregunta por pregunta. Las etiquetas por paso requieren emparejar antes los pasos. El acuerdo entre anotadores, explicado trata la elección del coeficiente.
¿Puedo usar Potato con trazas de LangSmith o Langfuse?
Sí. python -m potato.trace_converter convierte las exportaciones de ejecuciones de LangSmith con --input-format langchain y las de Langfuse con --input-format langfuse. Mantén el trazado de producción donde está y lleva a Potato las trazas que quieres juzgar.
Lecturas adicionales
- Herramientas de anotación con IA, comparadas, todos los tipos de datos en una página
- Potato frente a LangSmith y Langfuse para evaluar agentes
- Herramientas de anotación de texto comparadas
- Herramientas de anotación de audio comparadas
- Herramientas de anotación de imágenes comparadas
- Herramientas de anotación de vídeo comparadas
- Herramientas de evaluación de modelos del mundo y episodios de robots comparadas