Skip to content

प्रोसेस रिवॉर्ड मॉडल और चरण-स्तरीय लेबलिंग

Potato में agent के चरणों को सही या ग़लत लेबल करके process reward (PRM) डेटा कैसे जुटाएँ, first-error और per-step मोड समेत।

process reward model (PRM) किसी agent के तर्क के चरणों को अंक देता है, सिर्फ़ उसके आख़िरी जवाब को नहीं। ऐसा मॉडल प्रशिक्षित करने के लिए चरण-स्तरीय लेबल चाहिए: किसी trajectory के हर चरण पर यह कि वह सही था या नहीं। यही डेटा मॉडल को ठीक से तर्क करना सिखाता है, न कि तुक्के से सही जवाब पर पहुँचना।

PRM का उलटा है outcome reward model, जो सिर्फ़ अंतिम नतीजे को अंक देता है। चरण के स्तर पर लेबल लगाने से वे मामले पकड़ में आते हैं जहाँ मॉडल ख़राब तर्क के रास्ते सही जवाब तक पहुँच गया। फ़ीचर संदर्भ के लिए प्रोसेस रिवॉर्ड एनोटेशन देखें।

लेबलिंग के दो मोड

Potato का process_reward प्रकार दोनों प्रचलित स्कीम देता है:

  • First-error मोड: एनोटेटर वह पहला चरण चिह्नित करता है जहाँ बात बिगड़ती है; उसके बाद के हर चरण को अपने आप प्रभावित मान लिया जाता है। यह तेज़ है, और तर्क की चूक जिस तरह आगे तक फैलती है उससे मेल खाता है।
  • Per-step मोड: एनोटेटर हर चरण को अलग-अलग सही या ग़लत आँकता है। ज़्यादा बारीक, ज़्यादा मेहनत।
yaml
annotation_schemes:
  - annotation_type: process_reward
    name: step_rewards
    description: "Mark the first incorrect step. Steps after it are flagged automatically."
    steps_key: structured_turns
    mode: first_error
    mode: first_error

रंगों से यह फैलाव दिखता रहता है: हरे चरण ठीक हैं, लाल चरण पहली ग़लती है, और नारंगी उन आगे के चरणों को दिखाता है जो अब संदेह के घेरे में हैं।

कौन-सा मोड कब

  • First-error गणित, कोडिंग और जुड़ी हुई तर्क-शृंखलाओं के लिए, जहाँ एक ग़लती बाक़ी सब बेकार कर देती है। सस्ता है और आम तौर पर काफ़ी।
  • Per-step तब, जब चरण एक-दूसरे से स्वतंत्र हों, या जब आपको हर चरण के लिए सघन रिवॉर्ड संकेत चाहिए।

गुणवत्ता से जुड़ी बातें

  • “सही चरण” की परिभाषा ठीक-ठीक तय करें: सही और उपयोगी, या बस ग़लत न होना? दोहराव वाले पर नुक़सान न पहुँचाने वाले चरण के लिए भी एक नियम चाहिए।
  • किनारे के मामलों में तर्क व्यक्तिपरक हो जाता है, एक नमूने पर ओवरलैप इकट्ठा करें और सहमति जाँचें।
  • साथ में trajectory-स्तर का एक outcome लेबल भी रखें, ताकि आप देख सकें कि अच्छे नतीजों के पीछे ख़राब तर्क कहाँ छिपा है। देखें Agent trajectory का एनोटेशन

आगे पढ़ें