Skip to content

Dati di preferenza per RLHF

Come raccogliere dati di preferenza umana per RLHF e per l'allineamento dei modelli: confronti a coppie, punteggi con rubriche e giustificazioni, usando Potato.

Il reinforcement learning from human feedback (RLHF) addestra i modelli a seguire le preferenze umane. Il dato di partenza sono giudizi umani che confrontano output di modelli, quasi sempre nella forma «quale di queste due risposte è migliore?». Raccogliere bene quel dato è un problema di annotazione, e Potato lo affronta direttamente.

Per un inquadramento generale vedi reinforcement learning from human feedback.

La ricetta standard: preferenza a coppie

Mostri un prompt e due risposte candidate; l'annotatore sceglie la migliore. Questi giudizi addestrano un reward model che assegna punteggi agli output, e il reward model guida poi il policy model. HH-RLHF è il dataset di riferimento con esattamente questa forma.

yaml
annotation_schemes:
  - annotation_type: pairwise
    name: preference
    description: "Which response better follows the instruction and is more helpful and harmless?"
    mode: binary
    allow_tie: true
  - annotation_type: text
    name: rationale
    description: "One sentence on why you chose it."
    label_requirement:
      required: false

Vale la pena raccogliere anche una motivazione breve: ti permette di controllare i dati di preferenza e di individuare i casi in cui gli annotatori hanno ottimizzato la cosa sbagliata (lunghezza, formattazione) invece della qualità.

Per la meccanica del confronto vedi Confronto a coppie e best–worst scaling, e per valutare due modelli l'uno contro l'altro Confronto a coppie tra modelli.

Preferenze multidimensionali

Un unico giudizio su cosa sia «migliore» nasconde i compromessi. Per capire perché un output vince, assegna un punteggio a più criteri con una rubrica:

yaml
annotation_schemes:
  - annotation_type: rubric_eval
    name: quality
    description: "Rate the response on each dimension."
    scale_points: 5
    criteria:
      - {name: Helpfulness, description: "Does it actually answer the request?"}
      - {name: Harmlessness, description: "Is it safe and appropriate?"}
      - {name: Honesty, description: "Is it accurate and non-misleading?"}

Vedi Valutazione di LLM basata su rubriche. UltraFeedback è un grande dataset di preferenze raccolto così, con un punteggio separato per ciascun criterio.

Problemi di qualità tipici dei dati di preferenza

  • Bias di lunghezza e di stile. Gli annotatori tendono a preferire risposte più lunghe o più assertive a prescindere dalla correttezza. Nominalo nelle linee guida e tienilo d'occhio.
  • Bias di posizione. Randomizza quale risposta viene mostrata come «A».
  • Deriva della calibrazione. Ricondividi periodicamente gli esempi di riferimento, così gli standard non si spostano nel corso di una campagna lunga.
  • Accordo. La preferenza è soggettiva; raccogli annotazioni in sovrapposizione e monitora l'accordo.

Approfondimenti