Skip to content

Come misurare l'accordo tra un giudice LLM e annotatori umani

Verificare un LLM come giudice rispetto alle etichette umane: confrontare la kappa giudice-umano con la kappa umano-umano, misurare la calibrazione con ECE e punteggio di Brier, e testare il bias di posizione.

Per decidere se fidarti di un giudice LLM, fai etichettare un campione di elementi ad almeno due persone che non vedono le risposte del giudice, poi confronta l'accordo del giudice con quelle persone con l'accordo delle persone tra loro. Un giudice la cui kappa di Cohen con gli umani è vicina alla kappa degli umani tra loro se la cava più o meno come un altro annotatore. Uno molto al di sotto, no.

Un LLM come giudice è un modello linguistico a cui si chiede di valutare degli output, di solito con una rubrica. La kappa di Cohen misura l'accordo tra due valutatori, corretto per l'accordo atteso per caso. Un giudice è calibrato quando la sua confidenza corrisponde a quanto spesso ha ragione: dei verdetti che dà con l'80% di confidenza, circa l'80% dovrebbe essere corretto.

Perché l'accuratezza rispetto a una sola persona non basta

Il primo controllo abituale è l'accuratezza. Etichetti tu qualche centinaio di elementi e conti quante volte il giudice concorda. Quel numero ha due problemi. Tratta le etichette di una persona come la verità, errori compresi, e non è corretto per il caso, così un giudice che definisce "utile" ogni risposta ottiene un buon punteggio su un dataset in cui la maggior parte delle risposte è utile.

La kappa risolve il secondo problema. Un secondo annotatore umano risolve il primo, perché il disaccordo tra due persone attente mostra quanto consente il compito stesso, e da un giudice non si può pretendere di più.

Confrontare il giudice con l'accordo degli umani tra loro

Riporta tre tipi di coppie: umano con umano, giudice con umano e giudice con giudice se confronti più giudici. Se due persone concordano con κ = 0,62, un giudice a 0,60 con ciascuna di esse si comporta come un terzo annotatore, e chiedergli 0,9 significa chiedere più di quanto il compito consenta. Un giudice a 0,35 non concorda con le persone, per quanto buona sembri la sua accuratezza grezza.

Zheng et al. (2023) hanno fatto lo stesso confronto su MT-Bench e hanno trovato l'accordo di GPT-4 con le preferenze umane paragonabile all'accordo tra umani.

Con più di due umani, o con elementi a cui mancano alcune etichette, riporta anche la kappa di Fleiss o l'alfa di Krippendorff su tutti i valutatori, oltre alle kappa a coppie. L'accordo tra annotatori spiegato tratta la scelta.

Tenere gli umani in cieco

Se gli annotatori vedono la risposta del giudice, ci si ancorano, e parte dell'accordo che misuri è il giudice che concorda con se stesso. Raccogli le etichette umane senza le risposte del giudice sullo schermo. Lo stesso effetto fa salire l'accordo quando gli annotatori rivedono pre-etichette di un modello. Vedi Riconoscere le pre-etichette accettate senza controllo.

Controllare la confidenza oltre ai verdetti

Un giudice può concordare con le persone ed essere comunque troppo sicuro di sé. Se la sua confidenza decide quali elementi passano a un umano, l'eccesso di confidenza lascia che gli elementi sbagliati saltino la revisione.

Una confidenza che il modello dichiara su se stesso è testo generato come il resto della risposta. Il campionamento ne dà una empirica: interroga il giudice k volte per elemento con una temperatura superiore a zero, prendi la risposta più frequente come verdetto e la quota di campioni che l'hanno data come confidenza. A temperatura 0 i k campioni sono identici e ogni confidenza vale 1,0.

L'expected calibration error (ECE) raggruppa i verdetti per confidenza e confronta la confidenza di ogni gruppo con la sua accuratezza. Il punteggio di Brier è la differenza quadratica media tra confidenza ed esito. Un diagramma di affidabilità mette i gruppi a confronto con la diagonale che seguirebbe un giudice perfettamente calibrato.

Testare il bias di posizione nei giudici a coppie

Un giudice che confronta due risposte può preferire quella che compare per prima, o per seconda, indipendentemente dal contenuto. Zheng et al. hanno documentato questo bias di posizione nei giudici LLM. Esegui ogni coppia due volte, invertendo l'ordine. Un verdetto che si ribalta quando si ribalta l'ordine è stato deciso dalla posizione, e la quota di coppie che restano coerenti va riportata accanto all'accordo. Vedi Confronto di modelli a coppie.

Scale ordinate

In una valutazione da 1 a 5, un giudice che dice 4 dove un umano dice 5 ha quasi concordato. La kappa semplice lo conta come 1 contro 5. Usa la kappa ponderata o l'alfa di Krippendorff con una metrica ordinale o a intervalli, e riporta anche l'errore assoluto medio. Vedi Scale di valutazione.

Quanti elementi etichettare

Una kappa calcolata su 50 elementi ha un intervallo di confidenza ampio, tanto che due giudici possono sembrare diversi quando la differenza è rumore. Riporta l'intervallo insieme alla stima, e dimensiona il campione umano prima di iniziare; la potenza statistica per gli studi di annotazione spiega come. Stratificare il campione per etichetta del giudice ci mantiene le classi rare.

Come farlo in Potato

La calibrazione dei giudici di Potato esegue ogni giudice k volte per elemento e tiene le sue etichette in un archivio separato, così gli annotatori non le vedono mai. Poi estrae un campione casuale o stratificato per l'etichettatura umana in cieco e scrive un report.

yaml
annotation_schemes:
  - annotation_type: radio
    name: helpfulness
    description: "Is this response helpful?"
    labels: [helpful, unhelpful]
 
judge_calibration:
  enabled: true
  prompt: |
    You are an impartial expert annotator. Classify the response as exactly
    one of: helpful, unhelpful.
  models:
    - endpoint_type: ollama
      model: llama3.1:8b
      base_url: http://localhost:11434
      temperature: 0.7
  k_samples: 5
  sampling:
    strategy: stratified
    sample_size: 200
    seed: 42
  human:
    num_raters: 2
    gold: majority
  schemas: [helpfulness]

Il report fornisce accuratezza, precisione, richiamo e F1 di ciascun modello rispetto all'etichetta di riferimento umana, e la κ di Cohen suddivisa nelle coppie umano–modello, modello–modello e umano–umano. Aggiunge la κ di Fleiss e l'α di Krippendorff su tutti i valutatori, l'ECE con le classi di affidabilità e il punteggio di Brier, e una matrice di confusione per modello. Per gli schemi Likert aggiunge l'errore assoluto medio e l'α ordinale. Dalla versione 2.9 la scheda di valutazione del giudice mostra anche la coerenza con posizioni invertite, e le etichette generate si possono leggere su /judge_calibration/results prima che finisca la fase umana.

Calibrazione di LLM come giudice elenca tutte le opzioni. Allineamento del giudice tratta la messa a punto della rubrica di un singolo giudice rispetto a un insieme di riferimento esistente.

Altri strumenti

LangSmith, Langfuse e Galileo permettono di allineare un giudice alle correzioni umane. Langfuse calcola la κ di Cohen tra un punteggio umano e quello di un giudice, due serie alla volta. I piani a pagamento di Label Studio mostrano dove annotatori e LLM concordano. Vedi Strumenti di valutazione degli agenti IA a confronto.

Domande frequenti

Qual è una buona kappa tra un giudice LLM e gli umani?

Non esiste una soglia fissa. Confronta la kappa giudice-umano con la kappa tra due umani sugli stessi elementi. Un giudice vicino al valore umano-umano concorda con le persone più o meno come farebbe un altro annotatore. La consueta regola indicativa per κ e α, da 0,8 in su per fidarsi e da 0,67 a 0,8 per conclusioni provvisorie, descrive il compito nel suo insieme, e un compito difficile limita ciò che qualsiasi giudice può raggiungere.

Gli annotatori devono vedere la risposta del giudice LLM?

Non mentre misuri l'accordo. Gli annotatori che vedono il verdetto del giudice tendono ad ancorarsi a esso, gonfiando l'accordo apparente del giudice. Mostra il verdetto solo dopo che il campione di calibrazione è stato etichettato, se proprio lo mostri.

Come verifico se un giudice LLM ha un bias di posizione?

Presenta ogni coppia due volte, una per ciascun ordine, e conta quante volte il verdetto cambia con l'ordine. Riporta la quota di coppie coerenti accanto all'accordo, e scarta o ripeti le coppie in cui il verdetto si ribalta.

Cos'è l'expected calibration error di un giudice LLM?

L'ECE misura il divario tra la confidenza di un giudice e la sua accuratezza. I verdetti vengono raggruppati per confidenza, e l'ECE è la differenza media tra la confidenza di ogni gruppo e la quota dei suoi verdetti che ha concordato con l'etichetta umana, pesata per la dimensione del gruppo. Un giudice ben calibrato ha un ECE vicino a zero.

Approfondimenti