Giudicare il giudice: ragionamento umano e ragionamento del modello, affiancati
Un giudice LLM è affidabile solo quanto le etichette umane con cui l'hai validato. Metti la catena di pensiero di una persona accanto a quella di un modello sullo stesso elemento, e verifica il tuo giudice rispetto a etichette che portano con sé i propri intervalli di confidenza.
Chiunque valuti LLM su larga scala prima o poi usa un LLM come giudice, e prima o poi si chiede se di quel giudice ci si possa fidare. La risposta abituale è confrontarlo con etichette umane. Ma quel confronto vale quanto le etichette umane, e «il giudice è d'accordo con gli umani» è un'affermazione debole se gli umani erano in disaccordo tra loro e nessuno ha annotato di quanto. Qui si parla di come colmare quel divario: misurare come ragiona un modello, misurare come ragiona una persona e confrontare i due onestamente.
Potato 2.7 è organizzato attorno a una sola idea: uno strumento di annotazione dovrebbe misurare come si è formato un giudizio, non limitarsi a registrarlo. La parte interessante è che vale per entrambi i tipi di giudice.
Il problema di validare un giudice
Il flusso di lavoro standard è ragionevole. Hai un task troppo grande per etichettarlo a mano, quindi chiedi a un modello di assegnare i punteggi. Prima di fidarti dei punteggi prendi un campione, lo fai etichettare da delle persone e misuri l'accordo tra il giudice e le persone. Se il κ di Cohen è abbastanza alto, si va in produzione.
Il punto debole è l'ultimo passaggio. Quel κ confronta il tuo giudice con una etichetta umana, di solito un voto di maggioranza su due o tre annotatori. E un voto di maggioranza è una stima puntuale senza barra di errore. Dice «sarcastic» con esattamente la stessa confidenza sia che tutti e tre gli annotatori fossero d'accordo all'istante, sia che due abbiano avuto la meglio su un terzo dopo una lunga discussione.
Così, quando riporti che il tuo giudice concorda con gli umani a κ = 0.71, stai riportando l'accordo con un numero la cui incertezza non hai mai misurato. Se sugli elementi difficili le etichette umane sono poco più di un lancio di moneta, allora su quegli elementi il κ misura soprattutto rumore, e nessuna quantità di prompt engineering lo sposterà.
Della meccanica della calibrazione del giudice e dell'allineamento giudice-umano abbiamo già scritto. Quello che aggiunge la 2.7 è l'altra metà: fare in modo che il lato umano di quel confronto porti con sé la propria incertezza.
Prima dai barre di errore alle etichette umane
Il motore psicometrico adatta un modello di item response theory alle tue annotazioni umane e riporta ogni etichetta come distribuzione a posteriori con un intervallo (sarcastic, p = 0.94 [0.88 – 0.97]), pesando chi ha votato e non soltanto quanti.
Truth Serum aggiunge i punteggi per peer prediction, che segnalano gli elementi su cui la folla probabilmente sbaglia pur essendo stata sicura di sé.
A questo punto il confronto con il giudice cambia forma. Invece di
il giudice è d'accordo con l'etichetta di maggioranza sul 71% degli elementi
puoi dire
il giudice è d'accordo con la distribuzione a posteriori umana sul 94% degli elementi in cui l'etichetta umana è sicura (p > 0.9), e sul 52% degli elementi in cui non lo è. Quegli elementi a bassa confidenza sono il 18% dell'insieme.
La seconda affermazione permette di agire, la prima no. Ti dice che il tuo giudice va bene sui casi facili ed è inaffidabile su quelli difficili, e ti dice quanta parte dei tuoi dati è difficile. Ti dice anche una cosa scomoda e utile: sugli elementi genuinamente ambigui potrebbe non esistere alcuna verità di riferimento con cui il giudice possa essere d'accordo, e inseguire lì un κ più alto significa inseguire rumore.
È a questo che serve la dashboard di allineamento giudice-umano, ed è il motivo per cui le funzionalità sul processo umano e quelle sulla valutazione degli agenti stanno in un'unica release e non in due.
Due catene di pensiero sullo stesso elemento
L'altra metà del confronto è il ragionamento stesso.
La modalità Think-Aloud registra come una persona ragiona fino a un'etichetta. L'annotatore parla mentre lavora, il riconoscimento vocale gira in locale e la trascrizione viene conservata verbatim, non riassunta, perché parafrasare un protocollo think-aloud distrugge proprio quello che stavi raccogliendo.
La catena di pensiero umana, catturata verbatim
L'annotazione della process reward registra come ragiona un modello. La catena di pensiero del modello viene segmentata in passi, e ogni passo riceve un segnale di reward buono/cattivo/neutro, che è il segnale di addestramento di un modello di process reward.
annotation_schemes:
- annotation_type: process_reward
name: cot_review
description: "Rate each step of the model's reasoning."
steps_key: reasoning_stepsStesso elemento. Due catene di pensiero. Mettile una accanto all'altra.
Che cosa impari davvero dal confronto
L'uso ovvio è trovare dove il modello ragiona in modo diverso dalla persona, e vale la pena essere concreti sul perché la cosa conti.
La valutazione della sola risposta finale non vede la differenza tra un modello che ha dato la risposta giusta per il motivo giusto e uno che l'ha data per il motivo sbagliato. In un task sul sarcasmo, una persona potrebbe dire «qui è il "thanks so much" a fare tutto il lavoro. Nessuno ti ringrazia così tanto per due giorni di ritardo» (in originale: "the 'thanks so much' is doing the work here. Nobody thanks you that hard for a two-day delay."). Un modello potrebbe arrivare alla stessa etichetta perché il testo contiene un punto esclamativo. Entrambi vengono segnati come corretti. Solo uno dei due generalizzerà.
Dalle etichette non lo puoi rilevare. Dal ragionamento sì, ed è per questo che avere entrambi vale la fatica.
Il secondo uso sono i dati di addestramento. I passi in cui il ragionamento della persona e quello del modello divergono sono, quasi per definizione, i passi con più segnale in un dataset di process reward. Sono i punti in cui il processo del modello è sbagliato in un modo che il suo output non rivela.
Un limite dichiarato. Potato ti dà entrambe le superfici di cattura e le mette una accanto all'altra. Non calcola una metrica automatica di somiglianza tra la catena di pensiero di una persona e quella di un modello, e abbiamo deliberatamente scelto di non offrirne una. Che cosa significhi «queste due tracce di ragionamento sono d'accordo» è una domanda di ricerca aperta, e un numero inventato da noi sarebbe peggio di nessun numero, perché sembrerebbe autorevole e vorrebbe dire pochissimo. Quello che conta è l'artefatto; la metrica sta a te definirla.
Mettere insieme i pezzi
Una pipeline di valutazione difendibile nella 2.7 ha grosso modo questa forma.
- Etichetta un campione con delle persone, con la psicometria attiva. Ogni etichetta riceve una distribuzione a posteriori e un intervallo. Gli elementi ambigui vengono identificati come ambigui invece che etichettati male in silenzio.
- Esegui Truth Serum per intercettare gli elementi su cui una folla sicura di sé probabilmente sbaglia.
- Correggi la linea guida dove il rilevatore di errori nel codebook segnala una discriminazione negativa, meglio se in una stanza di norming in cui puoi vedere l'accordo muoversi mentre convergete.
- Calibra il giudice rispetto a quelle etichette, e riporta l'allineamento condizionato alla confidenza umana invece che come un numero solo.
- Controlla il ragionamento, non solo il verdetto, sugli elementi in cui il giudice e le persone sono in disaccordo.
Ogni passo è YAML, ospitato su server propri e gratuito. I passi da 1 a 3 non richiedono alcun LLM.
Niente di tutto questo rende affidabile un giudice LLM di per sé. Quello che fa è rendere reale l'affermazione di affidabilità: un'affermazione con un intervallo attaccato, rispetto a etichette umane che a loro volta hanno intervalli, su elementi della cui difficoltà puoi dire qualcosa di onesto.
È un'asticella più bassa di «il nostro giudice è allineato ai valori umani», e molto più utile.
Ulteriori letture
- Allineamento giudice ↔ umano e calibrazione del giudice
- Etichette con barre di errore — il livello IRT sotto tutto questo
- Controllo qualità senza etichette gold
- Modelli di process reward
- Modalità Think-Aloud
- Potato 2.7 — la release completa