Valutazione degli agenti
Valutazione degli output degli agenti da parte di persone e giudici LLM: calibrazione del giudice, revisione delle tracce, editing di traiettorie e valutazione in CI.
Questa sezione tratta l'output di un modello come qualcosa da rivedere, non da etichettare. L'unità di lavoro è di solito una traccia: una singola esecuzione di un agente, con le sue chiamate a strumenti, i passi intermedi e la risposta finale.
Calibrazione di LLM come giudice e Allineamento giudice ↔ umano coprono il caso in cui a valutare è un modello e devi sapere fino a che punto fidarti. Valutazione della traccia a tre riquadri (eval_trace) copre il caso in cui a valutare è una persona. Valutazione in CI copre l'esecuzione dell'uno o dell'altro a ogni commit.
Potato non addestra modelli. Tutto ciò che trovi qui produce etichette, punteggi e statistiche di accordo; che cosa farne dopo avviene fuori dallo strumento.