Annotare le traiettorie degli agenti
Come annotare passo per passo le traiettorie di un agente IA, tassonomie di errore, punteggio di gravità e successo a livello di traiettoria, con la valutazione delle traiettorie di Potato.
Una traiettoria è l'intera sequenza di passi compiuti da un agente, i suoi pensieri, le chiamate di strumenti e le osservazioni. Annotare una traiettoria significa giudicare il run nel suo complesso e segnare dove i singoli passi sono andati storti, con una categoria e una gravità per ciascun errore. Potato annota le traiettorie degli agenti passo per passo con rubriche personalizzate, è gratuito e self-hosted, e produce i dati che stanno dietro ai reward model e al debug mirato.
Per il riferimento della funzionalità, vedi Annotazione agentica.
Cosa raccogli quando annoti una traiettoria?
- Esito complessivo: successo, successo parziale o fallimento.
- Giudizi per passo: per ogni passo, era corretto, superfluo o sbagliato?
- Categorie di errore: perché un passo era sbagliato (strumento sbagliato, argomenti errati, allucinazione, loop, azione non sicura…).
- Gravità: quanto era grave ogni errore, spesso pesata in un punteggio.
Come imposto la valutazione delle traiettorie in Potato?
Il tipo trajectory_eval di Potato rende ogni passo come una scheda e vi associa una tassonomia di errori per passo con pesi di gravità:
annotation_schemes:
- annotation_type: trajectory_eval
name: step_evaluation
description: "Evaluate each step for correctness and mark any errors."
steps_key: steps
error_types:
- {name: reasoning, subtypes: [logical_error, factual_error, planning_error]}
- {name: execution, subtypes: [wrong_tool, wrong_args, api_error]}
- {name: safety, subtypes: [harmful_action, data_leak, scope_violation]}
severities:
- {name: minor, weight: -1}
- {name: major, weight: -5}
- {name: critical, weight: -10}
show_score: trueI pesi di gravità confluiscono in un punteggio della traiettoria, così puoi ordinare i run e seguire le regressioni tra versioni del modello.
Come progetto una tassonomia di errori per un agente?
La tassonomia è il cuore del task. Tienila piccola, esaustiva e a categorie mutuamente esclusive. Un punto di partenza pratico:
- Errori di ragionamento: conclusione sbagliata, evidenza ignorata, piano mal fatto.
- Errori di esecuzione: strumento sbagliato, chiamata malformata, risultato gestito male.
- Errori di sicurezza: azione non sicura, comportamento fuori ambito, esposizione di dati.
Aggiungi un campo di testo libero «altro» così gli annotatori non sono costretti a incasellare male le failure nuove, poi promuovi a categorie con un nome le note «altro» che ricorrono.
Considerazioni sulla qualità
- L'accordo sulla correttezza del passo di solito è alto; quello sulla categoria di errore è più basso. Misura entrambi, vedi Accordo tra annotatori.
- Le traiettorie lunghe stancano; metti un limite alla lunghezza o paginale.
- Il «primo passo sbagliato» è spesso ciò che conta di più per l'addestramento, vedi Modelli di reward di processo.
Approfondimenti
- Come ottenere etichette affidabili sulle traiettorie degli agenti, la trattazione più estesa del design della tassonomia, dell'accordo a livello di passo e dell'adjudication.
- Come valutare gli agenti IA
- Modelli di reward di processo
- Valutare l'uso degli strumenti