Skip to content

एजेंट ट्रेजेक्टरी एनोटेट करना

AI एजेंट की ट्रेजेक्टरी को चरण दर चरण कैसे एनोटेट करें, त्रुटि वर्गीकरण, गंभीरता स्कोरिंग, और ट्रेजेक्टरी-स्तर की सफलता, Potato के trajectory evaluation के साथ।

ट्रेजेक्टरी एजेंट द्वारा उठाए गए चरणों का पूरा क्रम है, उसके विचार, टूल कॉल, और अवलोकन। ट्रेजेक्टरी एनोटेट करने का मतलब है रन को समग्र रूप से आँकना और यह चिह्नित करना कि अलग-अलग चरण कहाँ गलत हुए, हर त्रुटि के लिए एक श्रेणी और एक गंभीरता के साथ। Potato एजेंट ट्रेजेक्टरी को कस्टम रुब्रिक के साथ चरण दर चरण एनोटेट करता है, मुफ़्त और सेल्फ़-होस्टेड, और वही डेटा तैयार करता है जिस पर रिवॉर्ड मॉडल और लक्षित डिबगिंग टिके होते हैं।

फ़ीचर संदर्भ के लिए एजेंटिक एनोटेशन देखें।

ट्रेजेक्टरी एनोटेट करते समय आप क्या इकट्ठा करते हैं?

  • समग्र परिणाम: success, partial success, या failure।
  • प्रति-चरण निर्णय: हर चरण के लिए, वह correct था, unnecessary था, या wrong?
  • त्रुटि श्रेणियाँ: चरण क्यों गलत था (गलत टूल, खराब आर्गुमेंट, hallucination, लूपिंग, असुरक्षित क्रिया…)।
  • गंभीरता: हर त्रुटि कितनी बुरी थी, अक्सर स्कोर में भार के रूप में।

Potato में trajectory evaluation कैसे सेट करूँ?

Potato का trajectory_eval प्रकार हर चरण को एक कार्ड के रूप में रेंडर करता है और उसके साथ गंभीरता भार वाला प्रति-चरण त्रुटि वर्गीकरण जोड़ देता है:

yaml
annotation_schemes:
  - annotation_type: trajectory_eval
    name: step_evaluation
    description: "Evaluate each step for correctness and mark any errors."
    steps_key: steps
    error_types:
      - {name: reasoning,  subtypes: [logical_error, factual_error, planning_error]}
      - {name: execution,  subtypes: [wrong_tool, wrong_args, api_error]}
      - {name: safety,     subtypes: [harmful_action, data_leak, scope_violation]}
    severities:
      - {name: minor,    weight: -1}
      - {name: major,    weight: -5}
      - {name: critical, weight: -10}
    show_score: true

गंभीरता भार मिलकर एक ट्रेजेक्टरी स्कोर बनाते हैं, जिससे आप रन को क्रम में रख सकते हैं और मॉडल संस्करणों के बीच गिरावट पर नज़र रख सकते हैं।

एजेंट त्रुटि वर्गीकरण कैसे डिज़ाइन करूँ?

वर्गीकरण ही कार्य का केंद्र है। इसे छोटा, पूर्ण, और परस्पर अनन्य रखें। शुरुआत के लिए एक व्यावहारिक सेट:

  • तर्क की त्रुटियाँ: गलत निष्कर्ष, अनदेखा किया गया साक्ष्य, खराब योजना।
  • निष्पादन की त्रुटियाँ: गलत टूल, बिगड़ी हुई कॉल, गलत तरीके से संभाला गया परिणाम।
  • सुरक्षा की त्रुटियाँ: असुरक्षित क्रिया, दायरे से बाहर का व्यवहार, डेटा का उजागर होना।

एक फ़्री-टेक्स्ट “other” जोड़ें ताकि एनोटेटर नई तरह की विफलताओं को ज़बरदस्ती गलत जगह न डालें, और जो “other” नोट बार-बार आएँ उन्हें नामित श्रेणी बना दें।

गुणवत्ता से जुड़ी बातें

  • चरण की शुद्धता पर सहमति आम तौर पर ऊँची रहती है; त्रुटि श्रेणी पर कम। दोनों मापें, इंटर-एनोटेटर सहमति देखें।
  • लंबी ट्रेजेक्टरी थका देती हैं; लंबाई सीमित करें या पन्नों में बाँटें।
  • प्रशिक्षण के लिए अक्सर “पहला गलत चरण” ही सबसे ज़्यादा मायने रखता है, प्रोसेस रिवॉर्ड मॉडल देखें।

आगे पढ़ें