Valutazione di agenti dal vivo
Come valutare un agente AI in tempo reale: mettere in pausa, inviare istruzioni, prendere il controllo, tornare indietro e ramificare con la vista per agenti dal vivo di Potato.
Quasi tutta la valutazione degli agenti avviene su una traccia già registrata. La valutazione dal vivo, invece, segue l'agente mentre lavora e permette a una persona di intervenire: fermarlo, dargli istruzioni, prendere il controllo o riportarlo indietro per provare un'altra strada. Per la valutazione con l'umano nel ciclo sul tuo server, Potato è uno strumento open source che raccoglie quello che una registrazione non può dare: dove una persona sarebbe intervenuta, e che aspetto ha un suggerimento migliore.
Per il riferimento della funzionalità, vedi Valutazione di Agenti dal Vivo e Agente di Coding dal Vivo.
Che cosa aggiunge la valutazione dal vivo?
- Pausa e ripresa: fermi l'agente a metà task per esaminarne lo stato.
- Invio di istruzioni: gli dai un'indicazione e osservi come si adatta.
- Presa di controllo: guidi tu a mano, poi restituisci il controllo. I punti di passaggio sono etichette preziose.
- Rollback e ramificazione: torni a un passo precedente e provi un'alternativa, confrontando percorsi che partono dallo stesso stato.
Ne escono dati interventisti, controfattuali su ciò che aiuta, e non solo etichette osservative.
Come si imposta la valutazione dal vivo in Potato?
La modalità dal vivo collega Potato a un agente in esecuzione tramite un endpoint (un proxy compatibile con OpenAI, un endpoint HTTP personalizzato o un backend per agenti di coding). L'annotatore interagisce attraverso la vista per agenti dal vivo.
live_agent:
endpoint_type: anthropic_vision # or coding_agent, openai_proxy, ...
ai_config:
model: claude-sonnet-4-20250514
api_key: ${ANTHROPIC_API_KEY}
max_steps: 30
allow_takeover: true
allow_instructions: trueQuando conviene usare la valutazione dal vivo?
- Costruire le linee guida: guardare dal vivo fa emergere le modalità di fallimento che vale la pena codificare in una tassonomia per l'etichettatura in blocco.
- Task interattivi: assistenti di chat e agenti che usano strumenti, dove quello che stai giudicando è l'interazione e non la sola trascrizione.
- Stress test: verificare come l'agente si riprende dopo un'indicazione o una deviazione forzata.
La valutazione dal vivo richiede più attenzione e rende meno in volume rispetto alla revisione di tracce registrate, quindi funziona su un campione mirato o per progettare il task in blocco. Per i grandi numeri, passa all'annotazione delle traiettorie sui run registrati.