Skip to content

Valutazione degli agenti

Valutazione degli output degli agenti da parte di persone e giudici LLM: calibrazione del giudice, revisione delle tracce, editing di traiettorie e valutazione in CI.

Questa sezione tratta l'output di un modello come qualcosa da rivedere, non da etichettare. L'unità di lavoro è di solito una traccia: una singola esecuzione di un agente, con le sue chiamate a strumenti, i passi intermedi e la risposta finale.

Calibrazione di LLM come giudice e Allineamento giudice ↔ umano coprono il caso in cui a valutare è un modello e devi sapere fino a che punto fidarti. Valutazione della traccia a tre riquadri (eval_trace) copre il caso in cui a valutare è una persona. Valutazione in CI copre l'esecuzione dell'uno o dell'altro a ogni commit.

Potato non addestra modelli. Tutto ciò che trovi qui produce etichette, punteggi e statistiche di accordo; che cosa farne dopo avviene fuori dallo strumento.