Skip to content

Confronto a coppie e best–worst scaling

Quando conviene raccogliere giudizi comparativi invece di punteggi assoluti, che cosa sono il confronto a coppie e il best-worst scaling (MaxDiff) e come configurarli in Potato.

Le persone danno punteggi assoluti poco stabili, ma confrontano bene. L'annotazione comparativa parte da qui: invece di «dai un voto da 1 a 5», chiedi «quale è migliore, A o B?». Le due forme principali sono il confronto a coppie e il best–worst scaling. Su di esse si reggono i dati di preferenza dell'AI di oggi.

Per un inquadramento, vedi pairwise comparison e MaxDiff.

Confronto a coppie

Mostri due elementi e chiedi quale vince. È semplice, produce un accordo alto ed è il formato con cui si raccolgono i dati di preferenza umana per il reinforcement learning from human feedback.

yaml
annotation_schemes:
  - annotation_type: pairwise
    name: preference
    description: "Which response better answers the question?"
    mode: binary
    allow_tie: true
    sequential_key_binding: true

Ammettere il pareggio evita che gli annotatori si inventino una differenza dove non c'è. Per registrare quanto è migliore, porta mode su una scala (per esempio «A molto meglio … B molto meglio»). La vetrina sulle preferenze a coppie è un esempio funzionante.

Tanti giudizi a coppie si possono trasformare in un'unica graduatoria con un modello come il sistema di punteggio Elo o il modello di Bradley–Terry.

Best–worst scaling (MaxDiff)

Mostri un piccolo insieme, spesso di quattro elementi, e chiedi il migliore e il peggiore. Ogni giudizio dice più di un singolo voto a coppie, perché fissa in una volta i due estremi dell'insieme.

yaml
annotation_schemes:
  - annotation_type: bws
    name: fluency
    description: "Pick the most and least fluent translation."
    tuple_size: 4
    best_description: "Most fluent"
    worst_description: "Least fluent"

Il best–worst scaling ricava punteggi affidabili, quasi su scala a intervalli, da scelte semplici, ed è molto usato per costruire graduatorie calibrate a partire da molti annotatori.

Quando preferire i confronti ai punteggi

  • Il costrutto che ti interessa è difficile da ancorare in assoluto (umorismo, utilità, qualità estetica).
  • Ti serve un accordo alto e la tua scala Likert è rumorosa.
  • Stai costruendo dati di preferenza per addestrare o allineare un modello.

Il prezzo è che ottieni informazione relativa: per risalire a punteggi assoluti può servirti un modello (Elo, Bradley–Terry).

Approfondimenti