Confronto a coppie di modelli
Come mettere a confronto diretto due modelli o due risposte con annotatori umani, dal confronto multidimensionale ai controlli sui bias, usando Potato.
Per decidere quale dei due modelli è migliore, mostra agli annotatori un prompt e le due risposte e chiedi quale vince. Aggregati su molti prompt, questi giudizi diretti ordinano i modelli in modo più affidabile dei punteggi assoluti. È il metodo dietro le classifiche pubbliche di modelli costruite sui voti umani.
Si tratta del pairwise comparison applicato agli output dei modelli; molti confronti si possono trasformare in un'unica graduatoria con un modello Elo o Bradley–Terry.
Confronto diretto di base
annotation_schemes:
- annotation_type: pairwise
name: which_better
description: "Which response is better overall?"
mode: binary
allow_tie: trueConfronto multidimensionale
Un unico «migliore» nasconde i compromessi: il modello A è più accurato, ma il modello B è più chiaro. Confronta più dimensioni insieme:
annotation_schemes:
- annotation_type: pairwise
name: comparison
description: "Compare the two responses on each dimension."
mode: multi_dimensionChiedere una giustificazione rende i dati verificabili e fa emergere i casi in cui gli annotatori hanno premiato la cosa sbagliata.
Tenere sotto controllo i bias
I dati di confronto diretto valgono quanto i controlli sui bias che li accompagnano:
- Bias di posizione: randomizza quale modello viene mostrato come «A», altrimenti gli annotatori favoriscono un lato.
- Bias di lunghezza e di stile: spesso si preferisce il testo più lungo o più sicuro di sé, a prescindere dalla qualità. Dillo nelle linee guida.
- Prolissità ≠ qualità: valuta se registrare la lunghezza, così puoi controllare se è lei a decidere chi vince.
- Accordo: raccogli sovrapposizione e monitora l'accordo tra annotatori.
Confronto o rubrica
Usa il confronto a coppie quando ti serve una graduatoria e vuoi un accordo alto. Usa una rubrica quando ti serve un profilo assoluto di ciascun modello, dimensione per dimensione. Molte valutazioni fanno entrambe le cose.