Skip to content

RLHF-Präferenzdaten sammeln

Wie du menschliche Präferenzdaten für RLHF und Model Alignment erhebst: paarweise Vergleiche, Bewertung nach Rubrik und kurze Begründungen, umgesetzt mit Potato.

Reinforcement Learning from Human Feedback (RLHF) trainiert Modelle darauf, menschlichen Präferenzen zu entsprechen. Die Datengrundlage sind menschliche Urteile über Modellausgaben, meist in der Form: Welche dieser beiden Antworten ist besser? Diese Daten gut zu erheben ist eine Annotationsaufgabe, und Potato deckt sie direkt ab.

Zum Hintergrund siehe reinforcement learning from human feedback.

Das Standardrezept: paarweise Präferenz

Zeige einen Prompt und zwei mögliche Antworten; die annotierende Person wählt die bessere. Aus diesen Urteilen entsteht ein Reward-Modell, das Ausgaben bewertet und damit das Policy-Modell steuert. HH-RLHF ist der kanonische Datensatz in genau dieser Form.

yaml
annotation_schemes:
  - annotation_type: pairwise
    name: preference
    description: "Which response better follows the instruction and is more helpful and harmless?"
    mode: binary
    allow_tie: true
  - annotation_type: text
    name: rationale
    description: "One sentence on why you chose it."
    label_requirement:
      required: false

Eine kurze Begründung lohnt sich: Damit lassen sich die Präferenzdaten prüfen und Fälle finden, in denen Annotierende auf das Falsche optimiert haben (Länge, Formatierung) statt auf Qualität.

Siehe Pairwise und Best–Worst-Scaling für die Mechanik des Vergleichs und Paarweiser Modellvergleich, wenn du zwei Modelle direkt gegeneinander stellen willst.

Mehrdimensionale Präferenzen

Ein einzelnes Besser-Urteil verdeckt die Abwägungen dahinter. Um Signal darüber zu bekommen, warum eine Ausgabe gewinnt, bewerte mehrere Kriterien über eine Rubrik:

yaml
annotation_schemes:
  - annotation_type: rubric_eval
    name: quality
    description: "Rate the response on each dimension."
    scale_points: 5
    criteria:
      - {name: Helpfulness, description: "Does it actually answer the request?"}
      - {name: Harmlessness, description: "Is it safe and appropriate?"}
      - {name: Honesty, description: "Is it accurate and non-misleading?"}

Siehe Rubrikbasierte LLM-Evaluation. UltraFeedback ist ein großer Präferenzdatensatz, der so erhoben wurde, mit einem eigenen Wert pro Kriterium.

Qualitätsfallen speziell bei Präferenzdaten

  • Längen- und Stilverzerrung. Annotierende bevorzugen oft die längere oder selbstbewusster formulierte Antwort, unabhängig davon, ob sie stimmt. Sprich das in den Richtlinien an und behalte es im Blick.
  • Positionsverzerrung. Randomisiere, welche Antwort als A angezeigt wird.
  • Kalibrierungsdrift. Zeige in Abständen wieder dieselben Ankerbeispiele, damit die Maßstäbe über eine lange Kampagne hinweg nicht wegdriften.
  • Übereinstimmung. Präferenz ist subjektiv; lass die Aufgaben überlappen und verfolge die Übereinstimmung.

Weiterführende Lektüre