Confronto a coppie e best–worst scaling
Quando conviene raccogliere giudizi comparativi invece di punteggi assoluti, che cosa sono il confronto a coppie e il best-worst scaling (MaxDiff) e come configurarli in Potato.
Le persone danno punteggi assoluti poco stabili, ma confrontano bene. L'annotazione comparativa parte da qui: invece di «dai un voto da 1 a 5», chiedi «quale è migliore, A o B?». Le due forme principali sono il confronto a coppie e il best–worst scaling. Su di esse si reggono i dati di preferenza dell'AI di oggi.
Per un inquadramento, vedi pairwise comparison e MaxDiff.
Confronto a coppie
Mostri due elementi e chiedi quale vince. È semplice, produce un accordo alto ed è il formato con cui si raccolgono i dati di preferenza umana per il reinforcement learning from human feedback.
annotation_schemes:
- annotation_type: pairwise
name: preference
description: "Which response better answers the question?"
mode: binary
allow_tie: true
sequential_key_binding: trueAmmettere il pareggio evita che gli annotatori si inventino una differenza dove non c'è. Per registrare quanto è migliore, porta mode su una scala (per esempio «A molto meglio … B molto meglio»). La vetrina sulle preferenze a coppie è un esempio funzionante.
Tanti giudizi a coppie si possono trasformare in un'unica graduatoria con un modello come il sistema di punteggio Elo o il modello di Bradley–Terry.
Best–worst scaling (MaxDiff)
Mostri un piccolo insieme, spesso di quattro elementi, e chiedi il migliore e il peggiore. Ogni giudizio dice più di un singolo voto a coppie, perché fissa in una volta i due estremi dell'insieme.
annotation_schemes:
- annotation_type: bws
name: fluency
description: "Pick the most and least fluent translation."
tuple_size: 4
best_description: "Most fluent"
worst_description: "Least fluent"Il best–worst scaling ricava punteggi affidabili, quasi su scala a intervalli, da scelte semplici, ed è molto usato per costruire graduatorie calibrate a partire da molti annotatori.
Quando preferire i confronti ai punteggi
- Il costrutto che ti interessa è difficile da ancorare in assoluto (umorismo, utilità, qualità estetica).
- Ti serve un accordo alto e la tua scala Likert è rumorosa.
- Stai costruendo dati di preferenza per addestrare o allineare un modello.
Il prezzo è che ottieni informazione relativa: per risalire a punteggi assoluti può servirti un modello (Elo, Bradley–Terry).
Approfondimenti
- Scale di valutazione, l'alternativa con punteggi assoluti
- Confronto a coppie di modelli, per confrontare output di AI
- Dati di preferenza per RLHF