Skip to content

AI agent का मूल्यांकन कैसे करें

इंसानी एनोटेशन से AI agent और LLM का मूल्यांकन करने की रूपरेखा, trajectory, चरण, span और तुलना के स्तर पर मूल्यांकन, और हर स्तर के लिए Potato का कौन-सा टूल सही बैठता है।

किसी AI agent का मूल्यांकन करने का मतलब है सिर्फ़ उसके आख़िरी जवाब को नहीं, बल्कि उस रास्ते को भी आँकना जो उसने लिया, यानी बीच का तर्क, tool call और कार्रवाइयाँ। इसके लिए इंसानी एनोटेशन आज भी सबसे भरोसेमंद पैमाना है, क्योंकि agent की कई नाकामियाँ (देखने में ठीक पर ग़लत चरण, कोई असुरक्षित कार्रवाई) सिर्फ़ इंसान ही ठीक से पकड़ पाता है। Potato LLM agent की trajectory पर इंसानी एनोटेशन के लिए बना ओपन-सोर्स टूल है, जिसमें मूल्यांकन के हर स्तर के लिए अलग डिस्प्ले है।

यहाँ AI agent से मतलब है ऐसी LLM-चालित प्रणाली जो कोई कार्य पूरा करने के लिए कई चरणों में कार्रवाई करती है, जैसे tool चलाना, ब्राउज़ करना, या कोड लिखना। देखें agent मूल्यांकन की रूपरेखा और एजेंटिक एनोटेशन संदर्भ।

AI agent के मूल्यांकन के स्तर कौन-कौन से हैं?

वही स्तर चुनें जो आपके सवाल से मेल खाता हो:

  • Trajectory स्तर: पूरे रन को आँकें। क्या वह सफल रहा? क्या वह कार्यकुशल और सुरक्षित था? देखें Agent trajectory का एनोटेशन
  • चरण स्तर: हर कार्रवाई को आँकें। क्या यह tool call सही था? क्या यह चरण ज़रूरी था? Process reward model के पीछे यही डेटा होता है।
  • Span स्तर: आउटपुट के भीतर की ख़ास दिक़्क़तें हाइलाइट करें, जैसे कोई गढ़ा हुआ दावा या असुरक्षित निर्देश। देखें Hallucination पकड़ना
  • तुलना स्तर: दो agent या दो रन को आमने-सामने रखकर आँकें। देखें जोड़ीवार मॉडल तुलना
  • टीम स्तर: बहु-agent प्रणालियों में किसी नाकामी को ज़िम्मेदार agent, चरण और handoff तक ले जाएँ। देखें बहु-agent प्रणालियों का मूल्यांकन कैसे करें

Potato किन agent ट्रेस फ़ॉर्मैट का समर्थन करता है?

Potato 15 फ़ॉर्मैट से agent ट्रेस पढ़ता है, जिनमें OpenAI और Anthropic के tool call, ReAct, LangChain, LangFuse, WebArena, SWE-bench, MCP, और OpenTelemetry शामिल हैं, और उन्हें agent के किस्म के हिसाब से बने डिस्प्ले में दिखाता है:

Agent मूल्यांकन का कौन-सा तरीक़ा चुनूँ?

आपका सवालतरीक़ा
“क्या agent ने कार्य पूरा किया?”Trajectory सफलता लेबल
“ग़लती ठीक कहाँ हुई?”चरण-स्तर की एरर वर्गीकरण सूची
“कौन-सा संस्करण बेहतर है?”जोड़ीवार तुलना
“कई पहलुओं पर यह कितना अच्छा है?”रूब्रिक मूल्यांकन
“क्या retrieved-context वाला जवाब स्रोत के प्रति वफ़ादार है?”RAG मूल्यांकन
“टीम के किस agent से नाकामी हुई?”बहु-agent ज़िम्मेदारी तय करना
“क्या computer-use agent ने सही जगह क्लिक किया?”GUI trajectory समीक्षा

आगे पढ़ें