Skip to content

Strumenti di valutazione degli agenti IA a confronto: LangSmith, Langfuse, Phoenix e Potato

Confronta LangSmith, Langfuse, Arize Phoenix, Braintrust, Opik, W&B Weave e Potato per la revisione umana delle tracce degli agenti: code di annotazione, etichette per passo, accordo e self-hosting.

Gli strumenti per valutare gli agenti IA sono di due tipi. Le piattaforme di osservabilità, tra cui LangSmith, Langfuse, Arize Phoenix, Braintrust e Opik, tracciano un agente in produzione e permettono ai revisori di assegnare punteggi a esecuzioni e span. Gli strumenti di annotazione come Potato partono dallo studio umano: più revisori per traccia, etichette su ogni passo e una misura di quanto i revisori concordano. I due funzionano insieme. Continua a tracciare dove tracci già, esporta le esecuzioni da giudicare e svolgi lo studio nello strumento di annotazione.

Una traccia di un agente, o traiettoria, registra ogni passo compiuto dall'agente: il suo ragionamento, gli strumenti chiamati e ciò che hanno restituito. La valutazione umana può dare un punteggio all'intera esecuzione, etichettare ogni passo o confrontare due esecuzioni affiancate. Un LLM come giudice dà punteggi alle tracce in automatico, e ha bisogno di etichette umane con cui essere verificato. Vedi Come valutare gli agenti IA.

Questa pagina tratta la valutazione di agenti e LLM. Strumenti di annotazione con IA a confronto copre tutti i tipi di dati in una sola pagina.

Quali strumenti di valutazione degli agenti conviene confrontare?

StrumentoPensato perRevisione umana
LangSmithTracciare e valutare applicazioni LangChain e LangGraphCode di annotazione con feedback su rubrica, più revisori per esecuzione, code a coppie
LangfuseTracciamento, gestione dei prompt e valutazione open sourceCode di annotazione e configurazioni di punteggio categoriali o numeriche
Arize PhoenixTracciamento e valutazioneConfigurazioni di annotazione per feedback categoriale, continuo e libero da persone, LLM o codice
BraintrustValutazione e loggingPunteggi di revisione umana: categoriali, continui e a testo libero
Comet OpikTracciamento e valutazione open sourceCode di annotazione condivise tramite link con esperti del dominio
W&B WeaveTracciamento e valutazioneScorer di annotazione umana definiti nell'interfaccia o via API
Label StudioAnnotazione genericaImporta tracce di LangGraph, CrewAI e AutoGen per la revisione passo per passo
PotatoStudi di annotazione umanaEtichette per passo con tassonomia degli errori, grafi multi-agente, confronto a coppie, accordo tra revisori

Self-hosting e prezzi degli strumenti presenti nella nostra matrice delle funzionalità:

Self-hostingPrezzo
LangSmithSolo con il piano Enterprise39 $ a postazione al mese
LangfuseGratuito (MIT)Gratuito in self-hosting
Comet OpikGratuito (Apache-2.0)Gratuito in self-hosting
GalileoContratto Enterprise100 $ al mese
PotatoGratuito (GPL-3.0)Gratuito

Cosa fa ogni piattaforma con i punteggi umani

Le code di annotazione di LangSmith supportano chiavi di feedback su rubrica, un numero configurabile di revisori per esecuzione, code a coppie e revisori che non vedono il feedback degli altri.

Langfuse definisce i punteggi tramite configurazioni di punteggio e smista tracce, osservazioni e sessioni ai revisori tramite code di annotazione. Nel suo forum della community, alcuni utenti hanno segnalato a novembre 2025 che due persone non potevano ancora annotare la stessa traccia in modo indipendente in una coda, e la soluzione alternativa discussa è una configurazione di punteggio separata per ogni annotatore (discussione #4348). Langfuse può calcolare la κ di Cohen tra un punteggio umano e quello di un giudice LLM, due serie alla volta.

Arize Phoenix dà alle annotazioni di persone, LLM e codice un'unica struttura, con configurazioni di annotazione che mantengono coerenti le etichette tra una revisione e l'altra. Gli span annotati si possono esportare in un dataset per esperimenti o per costruire un valutatore allineato al giudizio umano.

Braintrust associa punteggi di revisione umana a log ed esperimenti. La sua documentazione osserva che nascondere un punteggio ad alcuni revisori serve a sfoltire la schermata di revisione e non è un controllo degli accessi, perché qualsiasi revisore può mostrare tutti i punteggi.

Comet Opik mette tracce e thread in code di annotazione condivisibili tramite link con esperti del dominio, in una schermata di revisione pensata per revisori non tecnici.

W&B Weave registra il feedback umano tramite scorer di annotazione umana, creati nell'interfaccia o via API.

Nella documentazione sull'annotazione di LangSmith, Langfuse, Phoenix, Braintrust e Opik non abbiamo trovato alcuna statistica di accordo tra revisori umani, nelle verifiche di agosto e settembre 2026. Ciascuna raccoglie i giudizi umani come punteggi. Labelbox e Scale AI vendono dati di valutazione degli agenti come servizi gestiti, che è un acquisto diverso: forniscono anche i revisori.

In cosa si distingue Potato

  • Tracce da molti framework. I convertitori leggono 15 formati: ReAct, OpenAI, Anthropic, LangChain (che copre gli export di LangSmith), Langfuse, log multi-agente di CrewAI, AutoGen e LangGraph, SWE-bench, SWE-Agent, Claude Code, Aider, WebArena, Mind2Web e altre registrazioni del browser, MCP, OpenTelemetry e ATIF.
  • Etichette su ogni passo. Lo schema trajectory_eval registra se ogni passo era corretto, un tipo di errore da una tassonomia gerarchica, una gravità e un punteggio progressivo. Le stesse etichette sono i dati di addestramento per i process reward model.
  • Struttura multi-agente. I revisori modificano un grafo delle interazioni, segnano il percorso critico, attribuiscono un fallimento a un agente e a un passo, e rivedono i passaggi di consegna. La vista Agent Graphs di Langfuse mostra un'esecuzione multi-agente come grafo per il debug, ma i revisori non possono annotarla. Vedi Come valutare i sistemi multi-agente.
  • Accordo tra revisori. Ogni traccia può andare a più revisori che non vedono le etichette degli altri, e l'accordo tra annotatori viene riportato. La calibrazione del giudice confronta un giudice LLM con etichette umane in cieco. Vedi Come misurare l'accordo tra un giudice LLM e annotatori umani.
  • Agenti di programmazione e di uso del computer. Diff unificati con evidenziazione della sintassi, output del terminale e commenti di revisione ancorati alle righe. Le esecuzioni di uso del computer mostrano screenshot con la localizzazione dei clic. Vedi Valutazione degli agenti di programmazione e Valutazione degli agenti di uso del computer.

Portare le tracce in Potato

Esporta dallo strumento di osservabilità le esecuzioni da rivedere, poi convertile:

bash
python -m potato.trace_converter \
  --input langfuse_traces.json \
  --output data/traces.jsonl \
  --input-format langfuse

Gli export delle esecuzioni di LangSmith usano --input-format langchain. Se un framework non è nell'elenco, --auto-detect sceglie un convertitore in base ai nomi dei campi.

Un compito di revisione per passi in Potato

yaml
annotation_schemes:
  - annotation_type: trajectory_eval
    name: step_evaluation
    description: "Evaluate each step for correctness and mark any errors."
    steps_key: steps
    error_types:
      - {name: reasoning, subtypes: [logical_error, factual_error, planning_error]}
      - {name: execution, subtypes: [wrong_tool, wrong_args, api_error]}
    severities:
      - {name: minor, weight: -1}
      - {name: major, weight: -5}
    show_score: true

Vedi Annotare le traiettorie degli agenti per progettare la tassonomia degli errori.

Cosa non fa Potato con gli agenti

  • Non è un servizio di monitoraggio della produzione. Ha un SDK di tracciamento con export OpenTelemetry, ma nessun cloud ospitato e nessuna dashboard pensata per latenza e costi del traffico di produzione. Si ospita solo in proprio.
  • Non fornisce revisori. Porta i tuoi, o reclutali su Prolific.

Domande frequenti

Che differenza c'è tra LangSmith e Langfuse per la revisione umana?

Entrambi associano punteggi umani a tracce e span tramite code di annotazione. LangSmith è proprietario, si può ospitare in proprio con il piano Enterprise e supporta più revisori per esecuzione e code a coppie. Langfuse ha licenza MIT e si ospita in proprio gratis; nel suo forum gli utenti segnalano che due persone non possono ancora dare un punteggio alla stessa traccia in modo indipendente in una coda. Nessuno dei due documenta una statistica di accordo tra revisori umani.

Esiste un'alternativa open source a LangSmith per valutare gli agenti?

Per tracciamento e punteggi, Langfuse (MIT) e Comet Opik (Apache-2.0) sono open source e gratuiti in self-hosting. Per gli studi di valutazione umana, con più revisori per traccia, etichette per passo e accordo, Potato è open source e gratuito. Potato legge gli export di LangSmith e Langfuse, quindi può funzionare accanto a entrambi.

Come misuro l'accordo tra revisori umani delle tracce degli agenti?

Assegna ogni traccia ad almeno due revisori che non vedono le etichette degli altri, poi calcola la κ di Cohen per due revisori o l'α di Krippendorff per più, domanda per domanda. Le etichette per passo richiedono prima di abbinare i passi. L'accordo tra annotatori spiegato tratta la scelta del coefficiente.

Posso usare Potato con tracce di LangSmith o Langfuse?

Sì. python -m potato.trace_converter converte gli export delle esecuzioni di LangSmith con --input-format langchain e quelli di Langfuse con --input-format langfuse. Lascia il tracciamento di produzione dov'è e porta in Potato le tracce da giudicare.

Approfondimenti