Skip to content

RLHF और वरीयता डेटा जुटाना

RLHF और मॉडल संरेखण के लिए मानवीय वरीयता डेटा कैसे जुटाएँ: pairwise तुलना, रूब्रिक स्कोरिंग, और औचित्य, Potato के साथ।

मानवीय फ़ीडबैक से रीइनफ़ोर्समेंट लर्निंग (RLHF) मॉडल को इंसानी वरीयताओं से मिलाना सिखाती है। इसका मूल डेटा मॉडल के आउटपुट की तुलना करने वाले मानवीय निर्णय हैं, और अक्सर सवाल यही होता है कि इन दो जवाबों में बेहतर कौन-सा है। वह डेटा ढंग से जुटाना असल में एनोटेशन की समस्या है, और Potato इसे सीधे संभालता है।

पृष्ठभूमि के लिए देखें reinforcement learning from human feedback

मानक नुस्ख़ा: pairwise वरीयता

एक prompt और दो संभावित जवाब दिखाइए; एनोटेटर बेहतर वाला चुनता है। इन्हीं निर्णयों से वह reward model ट्रेन होता है जो आउटपुट को अंक देता है, और वही आगे policy मॉडल को दिशा देता है। HH-RLHF ठीक इसी आकार का जाना-पहचाना डेटासेट है।

yaml
annotation_schemes:
  - annotation_type: pairwise
    name: preference
    description: "Which response better follows the instruction and is more helpful and harmless?"
    mode: binary
    allow_tie: true
  - annotation_type: text
    name: rationale
    description: "One sentence on why you chose it."
    label_requirement:
      required: false

छोटा-सा कारण लिखवाना फ़ायदे का सौदा है: उससे आप वरीयता डेटा की जाँच कर पाते हैं और वे मामले पकड़ पाते हैं जहाँ एनोटेटर गुणवत्ता की जगह किसी और चीज़ पर चले गए, जैसे लंबाई या फ़ॉर्मैटिंग।

तुलना कैसे काम करती है इसके लिए देखें Pairwise और Best–Worst Scaling, और मॉडलों को आमने-सामने परखने के लिए Pairwise मॉडल तुलना

कई आयामों वाली वरीयताएँ

अकेला “बेहतर” निर्णय भीतर के समझौतों को छिपा देता है। एक आउटपुट क्यों जीता, इसका संकेत जुटाना हो तो रूब्रिक से कई कसौटियों पर अंक दिलवाएँ:

yaml
annotation_schemes:
  - annotation_type: rubric_eval
    name: quality
    description: "Rate the response on each dimension."
    scale_points: 5
    criteria:
      - {name: Helpfulness, description: "Does it actually answer the request?"}
      - {name: Harmlessness, description: "Is it safe and appropriate?"}
      - {name: Honesty, description: "Is it accurate and non-misleading?"}

देखें रूब्रिक-आधारित LLM मूल्यांकनUltraFeedback इसी तरीके से जुटाया गया एक बड़ा वरीयता डेटासेट है, जिसमें हर कसौटी का अलग स्कोर है।

वरीयता डेटा की अपनी गुणवत्ता समस्याएँ

  • लंबाई और शैली का bias. एनोटेटर अक्सर लंबे या ज़्यादा आत्मविश्वास से लिखे जवाब पसंद कर लेते हैं, चाहे वे सही हों या नहीं। दिशानिर्देशों में इसका नाम लेकर चेताएँ और नज़र रखें।
  • Position bias. कौन-सा जवाब “A” की जगह दिखेगा, इसे बेतरतीब रखें।
  • Calibration का खिसकना. बीच-बीच में anchor उदाहरण दोबारा साझा करें, ताकि लंबे अभियान में मानक न खिसकें।
  • सहमति. वरीयता व्यक्तिपरक होती है; ओवरलैप रखें और सहमति पर नज़र रखें।

आगे पढ़ें