Skip to content

Ferramentas de avaliação de agentes de IA comparadas: LangSmith, Langfuse, Phoenix e Potato

Compara LangSmith, Langfuse, Arize Phoenix, Braintrust, Opik, W&B Weave e Potato para a revisão humana de traces de agentes: filas de anotação, rótulos por passo, concordância e alojamento local.

As ferramentas para avaliar agentes de IA são de dois tipos. As plataformas de observabilidade, como o LangSmith, o Langfuse, o Arize Phoenix, o Braintrust e o Opik, registam um agente em produção e deixam os revisores atribuir classificações a execuções e spans. As ferramentas de anotação como o Potato partem do estudo humano: vários revisores por trace, rótulos em cada passo e uma medida de quanto os revisores concordam. As duas trabalham em conjunto. Continue a registar onde já regista, exporte as execuções que quer avaliar e faça o estudo na ferramenta de anotação.

Um trace de agente, ou trajetória, regista cada passo que o agente deu: o seu raciocínio, as ferramentas que chamou e o que devolveram. A avaliação humana pode classificar a execução inteira, rotular cada passo ou comparar duas execuções lado a lado. Um LLM como juiz classifica traces automaticamente e precisa de rótulos humanos para ser verificado. Veja Como avaliar agentes de IA.

Esta página trata da avaliação de agentes e de LLM. Ferramentas de anotação com IA, comparadas cobre todos os tipos de dados numa só página.

Que ferramentas de avaliação de agentes vale a pena comparar?

FerramentaFeita paraRevisão humana
LangSmithRegistar e avaliar aplicações LangChain e LangGraphFilas de anotação com feedback por rubrica, vários revisores por execução, filas por pares
LangfuseRegisto, gestão de prompts e avaliação de código abertoFilas de anotação e configurações de classificação categóricas ou numéricas
Arize PhoenixRegisto e avaliaçãoConfigurações de anotação para feedback categórico, contínuo e livre, vindo de pessoas, LLM ou código
BraintrustAvaliação e registoClassificações de revisão humana: categóricas, contínuas e de texto livre
Comet OpikRegisto e avaliação de código abertoFilas de anotação partilhadas por link com especialistas da área
W&B WeaveRegisto e avaliaçãoScorers de anotação humana definidos na interface ou por API
Label StudioAnotação geralImporta traces de LangGraph, CrewAI e AutoGen para revisão passo a passo
PotatoEstudos de anotação humanaRótulos por passo com taxonomia de erros, grafos multiagente, comparação por pares, concordância entre revisores

Alojamento local e preço das ferramentas da nossa matriz de capacidades:

Alojamento localPreço
LangSmithSó no plano Enterprise39 $ por posto por mês
LangfuseGratuito (MIT)Gratuito alojado localmente
Comet OpikGratuito (Apache-2.0)Gratuito alojado localmente
GalileoContrato Enterprise100 $ por mês
PotatoGratuito (GPL-3.0)Gratuito

O que cada plataforma faz com as classificações humanas

As filas de anotação do LangSmith suportam chaves de feedback por rubrica, um número configurável de revisores por execução, filas por pares e revisores que não veem o feedback uns dos outros.

O Langfuse define as classificações através de configurações de classificação e encaminha traces, observações e sessões para os revisores através de filas de anotação. No seu fórum da comunidade, utilizadores relataram em novembro de 2025 que duas pessoas ainda não conseguiam anotar o mesmo trace de forma independente numa fila, e a solução alternativa discutida é uma configuração de classificação separada para cada anotador (discussão #4348). O Langfuse consegue calcular o κ de Cohen entre uma classificação humana e a de um juiz LLM, duas séries de cada vez.

O Arize Phoenix dá às anotações de pessoas, de LLM e de código uma mesma estrutura, com configurações de anotação que mantêm os rótulos coerentes entre revisões. Os spans anotados podem ser exportados para um dataset, para experiências ou para construir um avaliador alinhado com o juízo humano.

O Braintrust associa classificações de revisão humana a registos e experiências. A sua documentação observa que esconder uma classificação de alguns revisores serve para arrumar o ecrã de revisão e não é um controlo de acesso, já que qualquer revisor pode mostrar todas as classificações.

O Comet Opik coloca traces e threads em filas de anotação que podem ser partilhadas por link com especialistas da área, num ecrã de revisão pensado para revisores sem perfil técnico.

O W&B Weave regista feedback humano através de scorers de anotação humana, criados na interface ou por API.

Na documentação de anotação do LangSmith, do Langfuse, do Phoenix, do Braintrust e do Opik não encontrámos nenhuma estatística de concordância entre revisores humanos, nas verificações de agosto e setembro de 2026. Cada uma recolhe os juízos humanos como classificações. O Labelbox e a Scale AI vendem dados de avaliação de agentes como serviços geridos, o que é outra compra: também fornecem os revisores.

Onde o Potato se distingue

  • Traces de muitos frameworks. Os conversores leem 15 formatos: ReAct, OpenAI, Anthropic, LangChain (que cobre as exportações do LangSmith), Langfuse, registos multiagente do CrewAI, AutoGen e LangGraph, SWE-bench, SWE-Agent, Claude Code, Aider, WebArena, Mind2Web e outras gravações de navegador, MCP, OpenTelemetry e ATIF.
  • Rótulos em cada passo. O esquema trajectory_eval regista se cada passo estava correto, um tipo de erro de uma taxonomia hierárquica, uma gravidade e uma classificação acumulada. Os mesmos rótulos são os dados de treino para modelos de recompensa de processo.
  • Estrutura multiagente. Os revisores editam um grafo de interações, marcam o caminho crítico, atribuem uma falha a um agente e a um passo, e revêm as passagens de testemunho. A vista Agent Graphs do Langfuse mostra uma execução multiagente como um grafo para depuração, mas os revisores não o podem anotar. Veja Como avaliar sistemas multiagente.
  • Concordância entre revisores. Cada trace pode ir para vários revisores que não veem os rótulos uns dos outros, e a concordância entre anotadores é reportada. A calibração do juiz compara um juiz LLM com rótulos humanos às cegas. Veja Como medir a concordância entre um juiz LLM e anotadores humanos.
  • Agentes de programação e de uso do computador. Diffs unificados com realce de sintaxe, saída do terminal e comentários de revisão ancorados a linhas. As execuções de uso do computador mostram capturas de ecrã com a localização dos cliques. Veja Avaliação de agentes de programação e Avaliação de agentes de uso do computador.

Levar traces para o Potato

Exporte da sua ferramenta de observabilidade as execuções que quer rever e converta-as:

bash
python -m potato.trace_converter \
  --input langfuse_traces.json \
  --output data/traces.jsonl \
  --input-format langfuse

As exportações de execuções do LangSmith usam --input-format langchain. Se um framework não estiver na lista, --auto-detect escolhe um conversor a partir dos nomes dos campos.

Uma tarefa de revisão passo a passo no Potato

yaml
annotation_schemes:
  - annotation_type: trajectory_eval
    name: step_evaluation
    description: "Evaluate each step for correctness and mark any errors."
    steps_key: steps
    error_types:
      - {name: reasoning, subtypes: [logical_error, factual_error, planning_error]}
      - {name: execution, subtypes: [wrong_tool, wrong_args, api_error]}
    severities:
      - {name: minor, weight: -1}
      - {name: major, weight: -5}
    show_score: true

Veja Anotar trajetórias de agentes para desenhar a taxonomia de erros.

O que o Potato não faz com agentes

  • Não é um serviço de monitorização de produção. Tem um SDK de registo com exportação para OpenTelemetry, mas não tem nuvem alojada nem painéis pensados para latência e custo do tráfego de produção. Só é alojado localmente.
  • Não fornece revisores. Traga os seus ou recrute-os no Prolific.

Perguntas frequentes

Qual é a diferença entre o LangSmith e o Langfuse para revisão humana?

Ambos associam classificações humanas a traces e spans através de filas de anotação. O LangSmith é proprietário, pode ser alojado localmente no plano Enterprise e suporta vários revisores por execução e filas por pares. O Langfuse tem licença MIT e aloja-se localmente de graça; no seu fórum, utilizadores relatam que duas pessoas ainda não conseguem classificar o mesmo trace de forma independente numa fila. Nenhum dos dois documenta uma estatística de concordância entre revisores humanos.

Existe uma alternativa de código aberto ao LangSmith para avaliar agentes?

Para registo e classificação, o Langfuse (MIT) e o Comet Opik (Apache-2.0) são de código aberto e gratuitos alojados localmente. Para estudos de avaliação humana, com vários revisores por trace, rótulos por passo e concordância, o Potato é de código aberto e gratuito. O Potato lê exportações do LangSmith e do Langfuse, por isso pode funcionar ao lado de qualquer um deles.

Como meço a concordância entre revisores humanos de traces de agentes?

Atribua cada trace a pelo menos dois revisores que não vejam os rótulos uns dos outros e calcule o κ de Cohen para dois revisores ou o α de Krippendorff para mais, pergunta a pergunta. Os rótulos por passo exigem emparelhar os passos primeiro. Concordância entre anotadores explicada trata da escolha do coeficiente.

Posso usar o Potato com traces do LangSmith ou do Langfuse?

Sim. python -m potato.trace_converter converte exportações de execuções do LangSmith com --input-format langchain e exportações do Langfuse com --input-format langfuse. Mantenha o registo de produção onde está e leve para o Potato os traces que quer avaliar.

Leituras adicionais