Dati di preferenza per RLHF
Come raccogliere dati di preferenza umana per RLHF e per l'allineamento dei modelli: confronti a coppie, punteggi con rubriche e giustificazioni, usando Potato.
Il reinforcement learning from human feedback (RLHF) addestra i modelli a seguire le preferenze umane. Il dato di partenza sono giudizi umani che confrontano output di modelli, quasi sempre nella forma «quale di queste due risposte è migliore?». Raccogliere bene quel dato è un problema di annotazione, e Potato lo affronta direttamente.
Per un inquadramento generale vedi reinforcement learning from human feedback.
La ricetta standard: preferenza a coppie
Mostri un prompt e due risposte candidate; l'annotatore sceglie la migliore. Questi giudizi addestrano un reward model che assegna punteggi agli output, e il reward model guida poi il policy model. HH-RLHF è il dataset di riferimento con esattamente questa forma.
annotation_schemes:
- annotation_type: pairwise
name: preference
description: "Which response better follows the instruction and is more helpful and harmless?"
mode: binary
allow_tie: true
- annotation_type: text
name: rationale
description: "One sentence on why you chose it."
label_requirement:
required: falseVale la pena raccogliere anche una motivazione breve: ti permette di controllare i dati di preferenza e di individuare i casi in cui gli annotatori hanno ottimizzato la cosa sbagliata (lunghezza, formattazione) invece della qualità.
Per la meccanica del confronto vedi Confronto a coppie e best–worst scaling, e per valutare due modelli l'uno contro l'altro Confronto a coppie tra modelli.
Preferenze multidimensionali
Un unico giudizio su cosa sia «migliore» nasconde i compromessi. Per capire perché un output vince, assegna un punteggio a più criteri con una rubrica:
annotation_schemes:
- annotation_type: rubric_eval
name: quality
description: "Rate the response on each dimension."
scale_points: 5
criteria:
- {name: Helpfulness, description: "Does it actually answer the request?"}
- {name: Harmlessness, description: "Is it safe and appropriate?"}
- {name: Honesty, description: "Is it accurate and non-misleading?"}Vedi Valutazione di LLM basata su rubriche. UltraFeedback è un grande dataset di preferenze raccolto così, con un punteggio separato per ciascun criterio.
Problemi di qualità tipici dei dati di preferenza
- Bias di lunghezza e di stile. Gli annotatori tendono a preferire risposte più lunghe o più assertive a prescindere dalla correttezza. Nominalo nelle linee guida e tienilo d'occhio.
- Bias di posizione. Randomizza quale risposta viene mostrata come «A».
- Deriva della calibrazione. Ricondividi periodicamente gli esempi di riferimento, così gli standard non si spostano nel corso di una campagna lunga.
- Accordo. La preferenza è soggettiva; raccogli annotazioni in sovrapposizione e monitora l'accordo.