Come valutare gli agenti AI
Panoramica sulla valutazione di agenti AI e LLM con annotazione umana: livello di traiettoria, passo, span e confronto, e quale strumento di Potato serve per ciascuno.
Valutare un agente AI significa giudicare non la sola risposta finale ma il percorso che ha seguito: il ragionamento, le chiamate agli strumenti e le azioni lungo la strada. Per questo l'annotazione umana resta il riferimento, perché molti fallimenti di un agente (un passo plausibile ma sbagliato, un'azione non sicura) solo una persona li coglie in modo affidabile. Potato è uno strumento open source per l'annotazione umana delle traiettorie di agenti LLM, con una visualizzazione dedicata per ciascun livello di valutazione.
Qui per agente AI si intende un sistema guidato da un LLM che compie azioni in più passi, chiamando strumenti, navigando o scrivendo codice, per portare a termine un task. Vedi la panoramica sulla valutazione degli agenti e il riferimento su Annotazione Agentiva.
Quali sono i livelli di valutazione di un agente AI?
Scegli il livello che corrisponde alla domanda che ti stai ponendo:
- Livello di traiettoria: giudichi l'intero run. Ha avuto successo? È stato efficiente e sicuro? Vedi Annotare le traiettorie degli agenti.
- Livello di passo: giudichi ogni azione. Questa chiamata a uno strumento era corretta? Questo passo era necessario? Sono i dati alla base dei modelli di reward di processo.
- Livello di span: evidenzi problemi puntuali dentro l'output, per esempio un'affermazione allucinata o un'istruzione non sicura. Vedi Individuare le allucinazioni.
- Livello di confronto: giudichi due agenti o due run a testa a testa. Vedi Confronto a coppie di modelli.
- Livello di team: nei sistemi multi-agente, attribuisci il fallimento all'agente, al passo e al passaggio di consegne responsabili. Vedi Come valutare i sistemi multi-agente.
Quali formati di traccia degli agenti supporta Potato?
Potato legge le tracce degli agenti da 15 formati, tra cui le chiamate agli strumenti di OpenAI e Anthropic, ReAct, LangChain, LangFuse, WebArena, SWE-bench, MCP e OpenTelemetry, e le mostra in visualizzazioni calibrate sul tipo di agente:
- Vista della traccia dell'agente per le tracce di ragionamento e uso degli strumenti.
- Vista per agenti web con screenshot e azioni sovrapposte, vedi Valutazione di agenti web.
- Vista delle tracce di codice con diff e output del terminale, vedi Valutazione degli agenti di programmazione.
- Vista per agenti dal vivo per osservare e guidare un agente in tempo reale, vedi Valutazione di agenti dal vivo.
- Viste per agenti multimodali dedicate ad agenti per uso del computer, vocali e video, vedi Valutare gli agenti per uso del computer e multimodali.
Quale metodo di valutazione conviene scegliere?
| La tua domanda | Approccio |
|---|---|
| «L'agente ha completato il task?» | Etichetta di successo sulla traiettoria |
| «Dove esattamente ha sbagliato?» | Tassonomia degli errori a livello di passo |
| «Quale versione è migliore?» | Confronto a coppie |
| «Quanto è buono su più assi?» | Valutazione con rubrica |
| «La risposta basata sul contesto recuperato è fedele?» | Valutazione RAG |
| «Quale agente del team ha causato il fallimento?» | Attribuzione multi-agente |
| «L'agente per uso del computer ha cliccato la cosa giusta?» | Revisione della traiettoria nella GUI |