प्रोसेस रिवॉर्ड मॉडल और चरण-स्तरीय लेबलिंग
Potato में agent के चरणों को सही या ग़लत लेबल करके process reward (PRM) डेटा कैसे जुटाएँ, first-error और per-step मोड समेत।
process reward model (PRM) किसी agent के तर्क के चरणों को अंक देता है, सिर्फ़ उसके आख़िरी जवाब को नहीं। ऐसा मॉडल प्रशिक्षित करने के लिए चरण-स्तरीय लेबल चाहिए: किसी trajectory के हर चरण पर यह कि वह सही था या नहीं। यही डेटा मॉडल को ठीक से तर्क करना सिखाता है, न कि तुक्के से सही जवाब पर पहुँचना।
PRM का उलटा है outcome reward model, जो सिर्फ़ अंतिम नतीजे को अंक देता है। चरण के स्तर पर लेबल लगाने से वे मामले पकड़ में आते हैं जहाँ मॉडल ख़राब तर्क के रास्ते सही जवाब तक पहुँच गया। फ़ीचर संदर्भ के लिए प्रोसेस रिवॉर्ड एनोटेशन देखें।
लेबलिंग के दो मोड
Potato का process_reward प्रकार दोनों प्रचलित स्कीम देता है:
- First-error मोड: एनोटेटर वह पहला चरण चिह्नित करता है जहाँ बात बिगड़ती है; उसके बाद के हर चरण को अपने आप प्रभावित मान लिया जाता है। यह तेज़ है, और तर्क की चूक जिस तरह आगे तक फैलती है उससे मेल खाता है।
- Per-step मोड: एनोटेटर हर चरण को अलग-अलग सही या ग़लत आँकता है। ज़्यादा बारीक, ज़्यादा मेहनत।
annotation_schemes:
- annotation_type: process_reward
name: step_rewards
description: "Mark the first incorrect step. Steps after it are flagged automatically."
steps_key: structured_turns
mode: first_error
mode: first_errorरंगों से यह फैलाव दिखता रहता है: हरे चरण ठीक हैं, लाल चरण पहली ग़लती है, और नारंगी उन आगे के चरणों को दिखाता है जो अब संदेह के घेरे में हैं।
कौन-सा मोड कब
- First-error गणित, कोडिंग और जुड़ी हुई तर्क-शृंखलाओं के लिए, जहाँ एक ग़लती बाक़ी सब बेकार कर देती है। सस्ता है और आम तौर पर काफ़ी।
- Per-step तब, जब चरण एक-दूसरे से स्वतंत्र हों, या जब आपको हर चरण के लिए सघन रिवॉर्ड संकेत चाहिए।
गुणवत्ता से जुड़ी बातें
- “सही चरण” की परिभाषा ठीक-ठीक तय करें: सही और उपयोगी, या बस ग़लत न होना? दोहराव वाले पर नुक़सान न पहुँचाने वाले चरण के लिए भी एक नियम चाहिए।
- किनारे के मामलों में तर्क व्यक्तिपरक हो जाता है, एक नमूने पर ओवरलैप इकट्ठा करें और सहमति जाँचें।
- साथ में trajectory-स्तर का एक outcome लेबल भी रखें, ताकि आप देख सकें कि अच्छे नतीजों के पीछे ख़राब तर्क कहाँ छिपा है। देखें Agent trajectory का एनोटेशन।
आगे पढ़ें
- Agent trajectory पर भरोसेमंद लेबल कैसे पाएँ, taxonomy डिज़ाइन और चरण-स्तरीय सहमति पर।
- Process Reward Annotation फ़ीचर संदर्भ
- Agent trajectory का एनोटेशन
- RLHF और वरीयता डेटा जुटाना