Skip to content

Come valutare gli agenti AI

Panoramica sulla valutazione di agenti AI e LLM con annotazione umana: livello di traiettoria, passo, span e confronto, e quale strumento di Potato serve per ciascuno.

Valutare un agente AI significa giudicare non la sola risposta finale ma il percorso che ha seguito: il ragionamento, le chiamate agli strumenti e le azioni lungo la strada. Per questo l'annotazione umana resta il riferimento, perché molti fallimenti di un agente (un passo plausibile ma sbagliato, un'azione non sicura) solo una persona li coglie in modo affidabile. Potato è uno strumento open source per l'annotazione umana delle traiettorie di agenti LLM, con una visualizzazione dedicata per ciascun livello di valutazione.

Qui per agente AI si intende un sistema guidato da un LLM che compie azioni in più passi, chiamando strumenti, navigando o scrivendo codice, per portare a termine un task. Vedi la panoramica sulla valutazione degli agenti e il riferimento su Annotazione Agentiva.

Quali sono i livelli di valutazione di un agente AI?

Scegli il livello che corrisponde alla domanda che ti stai ponendo:

Quali formati di traccia degli agenti supporta Potato?

Potato legge le tracce degli agenti da 15 formati, tra cui le chiamate agli strumenti di OpenAI e Anthropic, ReAct, LangChain, LangFuse, WebArena, SWE-bench, MCP e OpenTelemetry, e le mostra in visualizzazioni calibrate sul tipo di agente:

Quale metodo di valutazione conviene scegliere?

La tua domandaApproccio
«L'agente ha completato il task?»Etichetta di successo sulla traiettoria
«Dove esattamente ha sbagliato?»Tassonomia degli errori a livello di passo
«Quale versione è migliore?»Confronto a coppie
«Quanto è buono su più assi?»Valutazione con rubrica
«La risposta basata sul contesto recuperato è fedele?»Valutazione RAG
«Quale agente del team ha causato il fallimento?»Attribuzione multi-agente
«L'agente per uso del computer ha cliccato la cosa giusta?»Revisione della traiettoria nella GUI

Approfondimenti