RLHF और वरीयता डेटा जुटाना
RLHF और मॉडल संरेखण के लिए मानवीय वरीयता डेटा कैसे जुटाएँ: pairwise तुलना, रूब्रिक स्कोरिंग, और औचित्य, Potato के साथ।
मानवीय फ़ीडबैक से रीइनफ़ोर्समेंट लर्निंग (RLHF) मॉडल को इंसानी वरीयताओं से मिलाना सिखाती है। इसका मूल डेटा मॉडल के आउटपुट की तुलना करने वाले मानवीय निर्णय हैं, और अक्सर सवाल यही होता है कि इन दो जवाबों में बेहतर कौन-सा है। वह डेटा ढंग से जुटाना असल में एनोटेशन की समस्या है, और Potato इसे सीधे संभालता है।
पृष्ठभूमि के लिए देखें reinforcement learning from human feedback।
मानक नुस्ख़ा: pairwise वरीयता
एक prompt और दो संभावित जवाब दिखाइए; एनोटेटर बेहतर वाला चुनता है। इन्हीं निर्णयों से वह reward model ट्रेन होता है जो आउटपुट को अंक देता है, और वही आगे policy मॉडल को दिशा देता है। HH-RLHF ठीक इसी आकार का जाना-पहचाना डेटासेट है।
annotation_schemes:
- annotation_type: pairwise
name: preference
description: "Which response better follows the instruction and is more helpful and harmless?"
mode: binary
allow_tie: true
- annotation_type: text
name: rationale
description: "One sentence on why you chose it."
label_requirement:
required: falseछोटा-सा कारण लिखवाना फ़ायदे का सौदा है: उससे आप वरीयता डेटा की जाँच कर पाते हैं और वे मामले पकड़ पाते हैं जहाँ एनोटेटर गुणवत्ता की जगह किसी और चीज़ पर चले गए, जैसे लंबाई या फ़ॉर्मैटिंग।
तुलना कैसे काम करती है इसके लिए देखें Pairwise और Best–Worst Scaling, और मॉडलों को आमने-सामने परखने के लिए Pairwise मॉडल तुलना।
कई आयामों वाली वरीयताएँ
अकेला “बेहतर” निर्णय भीतर के समझौतों को छिपा देता है। एक आउटपुट क्यों जीता, इसका संकेत जुटाना हो तो रूब्रिक से कई कसौटियों पर अंक दिलवाएँ:
annotation_schemes:
- annotation_type: rubric_eval
name: quality
description: "Rate the response on each dimension."
scale_points: 5
criteria:
- {name: Helpfulness, description: "Does it actually answer the request?"}
- {name: Harmlessness, description: "Is it safe and appropriate?"}
- {name: Honesty, description: "Is it accurate and non-misleading?"}देखें रूब्रिक-आधारित LLM मूल्यांकन। UltraFeedback इसी तरीके से जुटाया गया एक बड़ा वरीयता डेटासेट है, जिसमें हर कसौटी का अलग स्कोर है।
वरीयता डेटा की अपनी गुणवत्ता समस्याएँ
- लंबाई और शैली का bias. एनोटेटर अक्सर लंबे या ज़्यादा आत्मविश्वास से लिखे जवाब पसंद कर लेते हैं, चाहे वे सही हों या नहीं। दिशानिर्देशों में इसका नाम लेकर चेताएँ और नज़र रखें।
- Position bias. कौन-सा जवाब “A” की जगह दिखेगा, इसे बेतरतीब रखें।
- Calibration का खिसकना. बीच-बीच में anchor उदाहरण दोबारा साझा करें, ताकि लंबे अभियान में मानक न खिसकें।
- सहमति. वरीयता व्यक्तिपरक होती है; ओवरलैप रखें और सहमति पर नज़र रखें।