Ferramentas de avaliação de agentes de IA comparadas: LangSmith, Langfuse, Phoenix e Potato
Compara LangSmith, Langfuse, Arize Phoenix, Braintrust, Opik, W&B Weave e Potato para a revisão humana de traces de agentes: filas de anotação, rótulos por passo, concordância e alojamento local.
As ferramentas para avaliar agentes de IA são de dois tipos. As plataformas de observabilidade, como o LangSmith, o Langfuse, o Arize Phoenix, o Braintrust e o Opik, registam um agente em produção e deixam os revisores atribuir classificações a execuções e spans. As ferramentas de anotação como o Potato partem do estudo humano: vários revisores por trace, rótulos em cada passo e uma medida de quanto os revisores concordam. As duas trabalham em conjunto. Continue a registar onde já regista, exporte as execuções que quer avaliar e faça o estudo na ferramenta de anotação.
Um trace de agente, ou trajetória, regista cada passo que o agente deu: o seu raciocínio, as ferramentas que chamou e o que devolveram. A avaliação humana pode classificar a execução inteira, rotular cada passo ou comparar duas execuções lado a lado. Um LLM como juiz classifica traces automaticamente e precisa de rótulos humanos para ser verificado. Veja Como avaliar agentes de IA.
Esta página trata da avaliação de agentes e de LLM. Ferramentas de anotação com IA, comparadas cobre todos os tipos de dados numa só página.
Que ferramentas de avaliação de agentes vale a pena comparar?
| Ferramenta | Feita para | Revisão humana |
|---|---|---|
| LangSmith | Registar e avaliar aplicações LangChain e LangGraph | Filas de anotação com feedback por rubrica, vários revisores por execução, filas por pares |
| Langfuse | Registo, gestão de prompts e avaliação de código aberto | Filas de anotação e configurações de classificação categóricas ou numéricas |
| Arize Phoenix | Registo e avaliação | Configurações de anotação para feedback categórico, contínuo e livre, vindo de pessoas, LLM ou código |
| Braintrust | Avaliação e registo | Classificações de revisão humana: categóricas, contínuas e de texto livre |
| Comet Opik | Registo e avaliação de código aberto | Filas de anotação partilhadas por link com especialistas da área |
| W&B Weave | Registo e avaliação | Scorers de anotação humana definidos na interface ou por API |
| Label Studio | Anotação geral | Importa traces de LangGraph, CrewAI e AutoGen para revisão passo a passo |
| Potato | Estudos de anotação humana | Rótulos por passo com taxonomia de erros, grafos multiagente, comparação por pares, concordância entre revisores |
Alojamento local e preço das ferramentas da nossa matriz de capacidades:
| Alojamento local | Preço | |
|---|---|---|
| LangSmith | Só no plano Enterprise | 39 $ por posto por mês |
| Langfuse | Gratuito (MIT) | Gratuito alojado localmente |
| Comet Opik | Gratuito (Apache-2.0) | Gratuito alojado localmente |
| Galileo | Contrato Enterprise | 100 $ por mês |
| Potato | Gratuito (GPL-3.0) | Gratuito |
O que cada plataforma faz com as classificações humanas
As filas de anotação do LangSmith suportam chaves de feedback por rubrica, um número configurável de revisores por execução, filas por pares e revisores que não veem o feedback uns dos outros.
O Langfuse define as classificações através de configurações de classificação e encaminha traces, observações e sessões para os revisores através de filas de anotação. No seu fórum da comunidade, utilizadores relataram em novembro de 2025 que duas pessoas ainda não conseguiam anotar o mesmo trace de forma independente numa fila, e a solução alternativa discutida é uma configuração de classificação separada para cada anotador (discussão #4348). O Langfuse consegue calcular o κ de Cohen entre uma classificação humana e a de um juiz LLM, duas séries de cada vez.
O Arize Phoenix dá às anotações de pessoas, de LLM e de código uma mesma estrutura, com configurações de anotação que mantêm os rótulos coerentes entre revisões. Os spans anotados podem ser exportados para um dataset, para experiências ou para construir um avaliador alinhado com o juízo humano.
O Braintrust associa classificações de revisão humana a registos e experiências. A sua documentação observa que esconder uma classificação de alguns revisores serve para arrumar o ecrã de revisão e não é um controlo de acesso, já que qualquer revisor pode mostrar todas as classificações.
O Comet Opik coloca traces e threads em filas de anotação que podem ser partilhadas por link com especialistas da área, num ecrã de revisão pensado para revisores sem perfil técnico.
O W&B Weave regista feedback humano através de scorers de anotação humana, criados na interface ou por API.
Na documentação de anotação do LangSmith, do Langfuse, do Phoenix, do Braintrust e do Opik não encontrámos nenhuma estatística de concordância entre revisores humanos, nas verificações de agosto e setembro de 2026. Cada uma recolhe os juízos humanos como classificações. O Labelbox e a Scale AI vendem dados de avaliação de agentes como serviços geridos, o que é outra compra: também fornecem os revisores.
Onde o Potato se distingue
- Traces de muitos frameworks. Os conversores leem 15 formatos: ReAct, OpenAI, Anthropic, LangChain (que cobre as exportações do LangSmith), Langfuse, registos multiagente do CrewAI, AutoGen e LangGraph, SWE-bench, SWE-Agent, Claude Code, Aider, WebArena, Mind2Web e outras gravações de navegador, MCP, OpenTelemetry e ATIF.
- Rótulos em cada passo. O esquema
trajectory_evalregista se cada passo estava correto, um tipo de erro de uma taxonomia hierárquica, uma gravidade e uma classificação acumulada. Os mesmos rótulos são os dados de treino para modelos de recompensa de processo. - Estrutura multiagente. Os revisores editam um grafo de interações, marcam o caminho crítico, atribuem uma falha a um agente e a um passo, e revêm as passagens de testemunho. A vista Agent Graphs do Langfuse mostra uma execução multiagente como um grafo para depuração, mas os revisores não o podem anotar. Veja Como avaliar sistemas multiagente.
- Concordância entre revisores. Cada trace pode ir para vários revisores que não veem os rótulos uns dos outros, e a concordância entre anotadores é reportada. A calibração do juiz compara um juiz LLM com rótulos humanos às cegas. Veja Como medir a concordância entre um juiz LLM e anotadores humanos.
- Agentes de programação e de uso do computador. Diffs unificados com realce de sintaxe, saída do terminal e comentários de revisão ancorados a linhas. As execuções de uso do computador mostram capturas de ecrã com a localização dos cliques. Veja Avaliação de agentes de programação e Avaliação de agentes de uso do computador.
Levar traces para o Potato
Exporte da sua ferramenta de observabilidade as execuções que quer rever e converta-as:
python -m potato.trace_converter \
--input langfuse_traces.json \
--output data/traces.jsonl \
--input-format langfuseAs exportações de execuções do LangSmith usam --input-format langchain. Se um framework não estiver na lista, --auto-detect escolhe um conversor a partir dos nomes dos campos.
Uma tarefa de revisão passo a passo no Potato
annotation_schemes:
- annotation_type: trajectory_eval
name: step_evaluation
description: "Evaluate each step for correctness and mark any errors."
steps_key: steps
error_types:
- {name: reasoning, subtypes: [logical_error, factual_error, planning_error]}
- {name: execution, subtypes: [wrong_tool, wrong_args, api_error]}
severities:
- {name: minor, weight: -1}
- {name: major, weight: -5}
show_score: trueVeja Anotar trajetórias de agentes para desenhar a taxonomia de erros.
O que o Potato não faz com agentes
- Não é um serviço de monitorização de produção. Tem um SDK de registo com exportação para OpenTelemetry, mas não tem nuvem alojada nem painéis pensados para latência e custo do tráfego de produção. Só é alojado localmente.
- Não fornece revisores. Traga os seus ou recrute-os no Prolific.
Perguntas frequentes
Qual é a diferença entre o LangSmith e o Langfuse para revisão humana?
Ambos associam classificações humanas a traces e spans através de filas de anotação. O LangSmith é proprietário, pode ser alojado localmente no plano Enterprise e suporta vários revisores por execução e filas por pares. O Langfuse tem licença MIT e aloja-se localmente de graça; no seu fórum, utilizadores relatam que duas pessoas ainda não conseguem classificar o mesmo trace de forma independente numa fila. Nenhum dos dois documenta uma estatística de concordância entre revisores humanos.
Existe uma alternativa de código aberto ao LangSmith para avaliar agentes?
Para registo e classificação, o Langfuse (MIT) e o Comet Opik (Apache-2.0) são de código aberto e gratuitos alojados localmente. Para estudos de avaliação humana, com vários revisores por trace, rótulos por passo e concordância, o Potato é de código aberto e gratuito. O Potato lê exportações do LangSmith e do Langfuse, por isso pode funcionar ao lado de qualquer um deles.
Como meço a concordância entre revisores humanos de traces de agentes?
Atribua cada trace a pelo menos dois revisores que não vejam os rótulos uns dos outros e calcule o κ de Cohen para dois revisores ou o α de Krippendorff para mais, pergunta a pergunta. Os rótulos por passo exigem emparelhar os passos primeiro. Concordância entre anotadores explicada trata da escolha do coeficiente.
Posso usar o Potato com traces do LangSmith ou do Langfuse?
Sim. python -m potato.trace_converter converte exportações de execuções do LangSmith com --input-format langchain e exportações do Langfuse com --input-format langfuse. Mantenha o registo de produção onde está e leve para o Potato os traces que quer avaliar.
Leituras adicionais
- Ferramentas de anotação com IA, comparadas, todos os tipos de dados numa página
- Potato vs LangSmith e Langfuse para avaliação de agentes
- Ferramentas de anotação de texto comparadas
- Ferramentas de anotação de áudio comparadas
- Ferramentas de anotação de imagens comparadas
- Ferramentas de anotação de vídeo comparadas
- Ferramentas de avaliação de modelos de mundo e episódios de robôs comparadas