Skip to content

Confronto a coppie di modelli

Come mettere a confronto diretto due modelli o due risposte con annotatori umani, dal confronto multidimensionale ai controlli sui bias, usando Potato.

Per decidere quale dei due modelli è migliore, mostra agli annotatori un prompt e le due risposte e chiedi quale vince. Aggregati su molti prompt, questi giudizi diretti ordinano i modelli in modo più affidabile dei punteggi assoluti. È il metodo dietro le classifiche pubbliche di modelli costruite sui voti umani.

Si tratta del pairwise comparison applicato agli output dei modelli; molti confronti si possono trasformare in un'unica graduatoria con un modello Elo o Bradley–Terry.

Confronto diretto di base

yaml
annotation_schemes:
  - annotation_type: pairwise
    name: which_better
    description: "Which response is better overall?"
    mode: binary
    allow_tie: true

Confronto multidimensionale

Un unico «migliore» nasconde i compromessi: il modello A è più accurato, ma il modello B è più chiaro. Confronta più dimensioni insieme:

yaml
annotation_schemes:
  - annotation_type: pairwise
    name: comparison
    description: "Compare the two responses on each dimension."
    mode: multi_dimension

Chiedere una giustificazione rende i dati verificabili e fa emergere i casi in cui gli annotatori hanno premiato la cosa sbagliata.

Tenere sotto controllo i bias

I dati di confronto diretto valgono quanto i controlli sui bias che li accompagnano:

  • Bias di posizione: randomizza quale modello viene mostrato come «A», altrimenti gli annotatori favoriscono un lato.
  • Bias di lunghezza e di stile: spesso si preferisce il testo più lungo o più sicuro di sé, a prescindere dalla qualità. Dillo nelle linee guida.
  • Prolissità ≠ qualità: valuta se registrare la lunghezza, così puoi controllare se è lei a decidere chi vince.
  • Accordo: raccogli sovrapposizione e monitora l'accordo tra annotatori.

Confronto o rubrica

Usa il confronto a coppie quando ti serve una graduatoria e vuoi un accordo alto. Usa una rubrica quando ti serve un profilo assoluto di ciascun modello, dimensione per dimensione. Molte valutazioni fanno entrambe le cose.

Approfondimenti