RLHF-Präferenzdaten sammeln
Wie du menschliche Präferenzdaten für RLHF und Model Alignment erhebst: paarweise Vergleiche, Bewertung nach Rubrik und kurze Begründungen, umgesetzt mit Potato.
Reinforcement Learning from Human Feedback (RLHF) trainiert Modelle darauf, menschlichen Präferenzen zu entsprechen. Die Datengrundlage sind menschliche Urteile über Modellausgaben, meist in der Form: Welche dieser beiden Antworten ist besser? Diese Daten gut zu erheben ist eine Annotationsaufgabe, und Potato deckt sie direkt ab.
Zum Hintergrund siehe reinforcement learning from human feedback.
Das Standardrezept: paarweise Präferenz
Zeige einen Prompt und zwei mögliche Antworten; die annotierende Person wählt die bessere. Aus diesen Urteilen entsteht ein Reward-Modell, das Ausgaben bewertet und damit das Policy-Modell steuert. HH-RLHF ist der kanonische Datensatz in genau dieser Form.
annotation_schemes:
- annotation_type: pairwise
name: preference
description: "Which response better follows the instruction and is more helpful and harmless?"
mode: binary
allow_tie: true
- annotation_type: text
name: rationale
description: "One sentence on why you chose it."
label_requirement:
required: falseEine kurze Begründung lohnt sich: Damit lassen sich die Präferenzdaten prüfen und Fälle finden, in denen Annotierende auf das Falsche optimiert haben (Länge, Formatierung) statt auf Qualität.
Siehe Pairwise und Best–Worst-Scaling für die Mechanik des Vergleichs und Paarweiser Modellvergleich, wenn du zwei Modelle direkt gegeneinander stellen willst.
Mehrdimensionale Präferenzen
Ein einzelnes Besser-Urteil verdeckt die Abwägungen dahinter. Um Signal darüber zu bekommen, warum eine Ausgabe gewinnt, bewerte mehrere Kriterien über eine Rubrik:
annotation_schemes:
- annotation_type: rubric_eval
name: quality
description: "Rate the response on each dimension."
scale_points: 5
criteria:
- {name: Helpfulness, description: "Does it actually answer the request?"}
- {name: Harmlessness, description: "Is it safe and appropriate?"}
- {name: Honesty, description: "Is it accurate and non-misleading?"}Siehe Rubrikbasierte LLM-Evaluation. UltraFeedback ist ein großer Präferenzdatensatz, der so erhoben wurde, mit einem eigenen Wert pro Kriterium.
Qualitätsfallen speziell bei Präferenzdaten
- Längen- und Stilverzerrung. Annotierende bevorzugen oft die längere oder selbstbewusster formulierte Antwort, unabhängig davon, ob sie stimmt. Sprich das in den Richtlinien an und behalte es im Blick.
- Positionsverzerrung. Randomisiere, welche Antwort als A angezeigt wird.
- Kalibrierungsdrift. Zeige in Abständen wieder dieselben Ankerbeispiele, damit die Maßstäbe über eine lange Kampagne hinweg nicht wegdriften.
- Übereinstimmung. Präferenz ist subjektiv; lass die Aufgaben überlappen und verfolge die Übereinstimmung.