Strumenti di valutazione degli agenti IA a confronto: LangSmith, Langfuse, Phoenix e Potato
Confronta LangSmith, Langfuse, Arize Phoenix, Braintrust, Opik, W&B Weave e Potato per la revisione umana delle tracce degli agenti: code di annotazione, etichette per passo, accordo e self-hosting.
Gli strumenti per valutare gli agenti IA sono di due tipi. Le piattaforme di osservabilità, tra cui LangSmith, Langfuse, Arize Phoenix, Braintrust e Opik, tracciano un agente in produzione e permettono ai revisori di assegnare punteggi a esecuzioni e span. Gli strumenti di annotazione come Potato partono dallo studio umano: più revisori per traccia, etichette su ogni passo e una misura di quanto i revisori concordano. I due funzionano insieme. Continua a tracciare dove tracci già, esporta le esecuzioni da giudicare e svolgi lo studio nello strumento di annotazione.
Una traccia di un agente, o traiettoria, registra ogni passo compiuto dall'agente: il suo ragionamento, gli strumenti chiamati e ciò che hanno restituito. La valutazione umana può dare un punteggio all'intera esecuzione, etichettare ogni passo o confrontare due esecuzioni affiancate. Un LLM come giudice dà punteggi alle tracce in automatico, e ha bisogno di etichette umane con cui essere verificato. Vedi Come valutare gli agenti IA.
Questa pagina tratta la valutazione di agenti e LLM. Strumenti di annotazione con IA a confronto copre tutti i tipi di dati in una sola pagina.
Quali strumenti di valutazione degli agenti conviene confrontare?
| Strumento | Pensato per | Revisione umana |
|---|---|---|
| LangSmith | Tracciare e valutare applicazioni LangChain e LangGraph | Code di annotazione con feedback su rubrica, più revisori per esecuzione, code a coppie |
| Langfuse | Tracciamento, gestione dei prompt e valutazione open source | Code di annotazione e configurazioni di punteggio categoriali o numeriche |
| Arize Phoenix | Tracciamento e valutazione | Configurazioni di annotazione per feedback categoriale, continuo e libero da persone, LLM o codice |
| Braintrust | Valutazione e logging | Punteggi di revisione umana: categoriali, continui e a testo libero |
| Comet Opik | Tracciamento e valutazione open source | Code di annotazione condivise tramite link con esperti del dominio |
| W&B Weave | Tracciamento e valutazione | Scorer di annotazione umana definiti nell'interfaccia o via API |
| Label Studio | Annotazione generica | Importa tracce di LangGraph, CrewAI e AutoGen per la revisione passo per passo |
| Potato | Studi di annotazione umana | Etichette per passo con tassonomia degli errori, grafi multi-agente, confronto a coppie, accordo tra revisori |
Self-hosting e prezzi degli strumenti presenti nella nostra matrice delle funzionalità:
| Self-hosting | Prezzo | |
|---|---|---|
| LangSmith | Solo con il piano Enterprise | 39 $ a postazione al mese |
| Langfuse | Gratuito (MIT) | Gratuito in self-hosting |
| Comet Opik | Gratuito (Apache-2.0) | Gratuito in self-hosting |
| Galileo | Contratto Enterprise | 100 $ al mese |
| Potato | Gratuito (GPL-3.0) | Gratuito |
Cosa fa ogni piattaforma con i punteggi umani
Le code di annotazione di LangSmith supportano chiavi di feedback su rubrica, un numero configurabile di revisori per esecuzione, code a coppie e revisori che non vedono il feedback degli altri.
Langfuse definisce i punteggi tramite configurazioni di punteggio e smista tracce, osservazioni e sessioni ai revisori tramite code di annotazione. Nel suo forum della community, alcuni utenti hanno segnalato a novembre 2025 che due persone non potevano ancora annotare la stessa traccia in modo indipendente in una coda, e la soluzione alternativa discussa è una configurazione di punteggio separata per ogni annotatore (discussione #4348). Langfuse può calcolare la κ di Cohen tra un punteggio umano e quello di un giudice LLM, due serie alla volta.
Arize Phoenix dà alle annotazioni di persone, LLM e codice un'unica struttura, con configurazioni di annotazione che mantengono coerenti le etichette tra una revisione e l'altra. Gli span annotati si possono esportare in un dataset per esperimenti o per costruire un valutatore allineato al giudizio umano.
Braintrust associa punteggi di revisione umana a log ed esperimenti. La sua documentazione osserva che nascondere un punteggio ad alcuni revisori serve a sfoltire la schermata di revisione e non è un controllo degli accessi, perché qualsiasi revisore può mostrare tutti i punteggi.
Comet Opik mette tracce e thread in code di annotazione condivisibili tramite link con esperti del dominio, in una schermata di revisione pensata per revisori non tecnici.
W&B Weave registra il feedback umano tramite scorer di annotazione umana, creati nell'interfaccia o via API.
Nella documentazione sull'annotazione di LangSmith, Langfuse, Phoenix, Braintrust e Opik non abbiamo trovato alcuna statistica di accordo tra revisori umani, nelle verifiche di agosto e settembre 2026. Ciascuna raccoglie i giudizi umani come punteggi. Labelbox e Scale AI vendono dati di valutazione degli agenti come servizi gestiti, che è un acquisto diverso: forniscono anche i revisori.
In cosa si distingue Potato
- Tracce da molti framework. I convertitori leggono 15 formati: ReAct, OpenAI, Anthropic, LangChain (che copre gli export di LangSmith), Langfuse, log multi-agente di CrewAI, AutoGen e LangGraph, SWE-bench, SWE-Agent, Claude Code, Aider, WebArena, Mind2Web e altre registrazioni del browser, MCP, OpenTelemetry e ATIF.
- Etichette su ogni passo. Lo schema
trajectory_evalregistra se ogni passo era corretto, un tipo di errore da una tassonomia gerarchica, una gravità e un punteggio progressivo. Le stesse etichette sono i dati di addestramento per i process reward model. - Struttura multi-agente. I revisori modificano un grafo delle interazioni, segnano il percorso critico, attribuiscono un fallimento a un agente e a un passo, e rivedono i passaggi di consegna. La vista Agent Graphs di Langfuse mostra un'esecuzione multi-agente come grafo per il debug, ma i revisori non possono annotarla. Vedi Come valutare i sistemi multi-agente.
- Accordo tra revisori. Ogni traccia può andare a più revisori che non vedono le etichette degli altri, e l'accordo tra annotatori viene riportato. La calibrazione del giudice confronta un giudice LLM con etichette umane in cieco. Vedi Come misurare l'accordo tra un giudice LLM e annotatori umani.
- Agenti di programmazione e di uso del computer. Diff unificati con evidenziazione della sintassi, output del terminale e commenti di revisione ancorati alle righe. Le esecuzioni di uso del computer mostrano screenshot con la localizzazione dei clic. Vedi Valutazione degli agenti di programmazione e Valutazione degli agenti di uso del computer.
Portare le tracce in Potato
Esporta dallo strumento di osservabilità le esecuzioni da rivedere, poi convertile:
python -m potato.trace_converter \
--input langfuse_traces.json \
--output data/traces.jsonl \
--input-format langfuseGli export delle esecuzioni di LangSmith usano --input-format langchain. Se un framework non è nell'elenco, --auto-detect sceglie un convertitore in base ai nomi dei campi.
Un compito di revisione per passi in Potato
annotation_schemes:
- annotation_type: trajectory_eval
name: step_evaluation
description: "Evaluate each step for correctness and mark any errors."
steps_key: steps
error_types:
- {name: reasoning, subtypes: [logical_error, factual_error, planning_error]}
- {name: execution, subtypes: [wrong_tool, wrong_args, api_error]}
severities:
- {name: minor, weight: -1}
- {name: major, weight: -5}
show_score: trueVedi Annotare le traiettorie degli agenti per progettare la tassonomia degli errori.
Cosa non fa Potato con gli agenti
- Non è un servizio di monitoraggio della produzione. Ha un SDK di tracciamento con export OpenTelemetry, ma nessun cloud ospitato e nessuna dashboard pensata per latenza e costi del traffico di produzione. Si ospita solo in proprio.
- Non fornisce revisori. Porta i tuoi, o reclutali su Prolific.
Domande frequenti
Che differenza c'è tra LangSmith e Langfuse per la revisione umana?
Entrambi associano punteggi umani a tracce e span tramite code di annotazione. LangSmith è proprietario, si può ospitare in proprio con il piano Enterprise e supporta più revisori per esecuzione e code a coppie. Langfuse ha licenza MIT e si ospita in proprio gratis; nel suo forum gli utenti segnalano che due persone non possono ancora dare un punteggio alla stessa traccia in modo indipendente in una coda. Nessuno dei due documenta una statistica di accordo tra revisori umani.
Esiste un'alternativa open source a LangSmith per valutare gli agenti?
Per tracciamento e punteggi, Langfuse (MIT) e Comet Opik (Apache-2.0) sono open source e gratuiti in self-hosting. Per gli studi di valutazione umana, con più revisori per traccia, etichette per passo e accordo, Potato è open source e gratuito. Potato legge gli export di LangSmith e Langfuse, quindi può funzionare accanto a entrambi.
Come misuro l'accordo tra revisori umani delle tracce degli agenti?
Assegna ogni traccia ad almeno due revisori che non vedono le etichette degli altri, poi calcola la κ di Cohen per due revisori o l'α di Krippendorff per più, domanda per domanda. Le etichette per passo richiedono prima di abbinare i passi. L'accordo tra annotatori spiegato tratta la scelta del coefficiente.
Posso usare Potato con tracce di LangSmith o Langfuse?
Sì. python -m potato.trace_converter converte gli export delle esecuzioni di LangSmith con --input-format langchain e quelli di Langfuse con --input-format langfuse. Lascia il tracciamento di produzione dov'è e porta in Potato le tracce da giudicare.
Approfondimenti
- Strumenti di annotazione con IA a confronto, tutti i tipi di dati in una pagina
- Potato contro LangSmith e Langfuse per la valutazione degli agenti
- Strumenti di annotazione del testo a confronto
- Strumenti di annotazione audio a confronto
- Strumenti di annotazione delle immagini a confronto
- Strumenti di annotazione video a confronto
- Strumenti di valutazione di world model ed episodi robotici a confronto