Skip to content

Annotare le traiettorie degli agenti

Come annotare passo per passo le traiettorie di un agente IA, tassonomie di errore, punteggio di gravità e successo a livello di traiettoria, con la valutazione delle traiettorie di Potato.

Una traiettoria è l'intera sequenza di passi compiuti da un agente, i suoi pensieri, le chiamate di strumenti e le osservazioni. Annotare una traiettoria significa giudicare il run nel suo complesso e segnare dove i singoli passi sono andati storti, con una categoria e una gravità per ciascun errore. Potato annota le traiettorie degli agenti passo per passo con rubriche personalizzate, è gratuito e self-hosted, e produce i dati che stanno dietro ai reward model e al debug mirato.

Per il riferimento della funzionalità, vedi Annotazione agentica.

Cosa raccogli quando annoti una traiettoria?

  • Esito complessivo: successo, successo parziale o fallimento.
  • Giudizi per passo: per ogni passo, era corretto, superfluo o sbagliato?
  • Categorie di errore: perché un passo era sbagliato (strumento sbagliato, argomenti errati, allucinazione, loop, azione non sicura…).
  • Gravità: quanto era grave ogni errore, spesso pesata in un punteggio.

Come imposto la valutazione delle traiettorie in Potato?

Il tipo trajectory_eval di Potato rende ogni passo come una scheda e vi associa una tassonomia di errori per passo con pesi di gravità:

yaml
annotation_schemes:
  - annotation_type: trajectory_eval
    name: step_evaluation
    description: "Evaluate each step for correctness and mark any errors."
    steps_key: steps
    error_types:
      - {name: reasoning,  subtypes: [logical_error, factual_error, planning_error]}
      - {name: execution,  subtypes: [wrong_tool, wrong_args, api_error]}
      - {name: safety,     subtypes: [harmful_action, data_leak, scope_violation]}
    severities:
      - {name: minor,    weight: -1}
      - {name: major,    weight: -5}
      - {name: critical, weight: -10}
    show_score: true

I pesi di gravità confluiscono in un punteggio della traiettoria, così puoi ordinare i run e seguire le regressioni tra versioni del modello.

Come progetto una tassonomia di errori per un agente?

La tassonomia è il cuore del task. Tienila piccola, esaustiva e a categorie mutuamente esclusive. Un punto di partenza pratico:

  • Errori di ragionamento: conclusione sbagliata, evidenza ignorata, piano mal fatto.
  • Errori di esecuzione: strumento sbagliato, chiamata malformata, risultato gestito male.
  • Errori di sicurezza: azione non sicura, comportamento fuori ambito, esposizione di dati.

Aggiungi un campo di testo libero «altro» così gli annotatori non sono costretti a incasellare male le failure nuove, poi promuovi a categorie con un nome le note «altro» che ricorrono.

Considerazioni sulla qualità

  • L'accordo sulla correttezza del passo di solito è alto; quello sulla categoria di errore è più basso. Misura entrambi, vedi Accordo tra annotatori.
  • Le traiettorie lunghe stancano; metti un limite alla lunghezza o paginale.
  • Il «primo passo sbagliato» è spesso ciò che conta di più per l'addestramento, vedi Modelli di reward di processo.

Approfondimenti