AI agent का मूल्यांकन कैसे करें
इंसानी एनोटेशन से AI agent और LLM का मूल्यांकन करने की रूपरेखा, trajectory, चरण, span और तुलना के स्तर पर मूल्यांकन, और हर स्तर के लिए Potato का कौन-सा टूल सही बैठता है।
किसी AI agent का मूल्यांकन करने का मतलब है सिर्फ़ उसके आख़िरी जवाब को नहीं, बल्कि उस रास्ते को भी आँकना जो उसने लिया, यानी बीच का तर्क, tool call और कार्रवाइयाँ। इसके लिए इंसानी एनोटेशन आज भी सबसे भरोसेमंद पैमाना है, क्योंकि agent की कई नाकामियाँ (देखने में ठीक पर ग़लत चरण, कोई असुरक्षित कार्रवाई) सिर्फ़ इंसान ही ठीक से पकड़ पाता है। Potato LLM agent की trajectory पर इंसानी एनोटेशन के लिए बना ओपन-सोर्स टूल है, जिसमें मूल्यांकन के हर स्तर के लिए अलग डिस्प्ले है।
यहाँ AI agent से मतलब है ऐसी LLM-चालित प्रणाली जो कोई कार्य पूरा करने के लिए कई चरणों में कार्रवाई करती है, जैसे tool चलाना, ब्राउज़ करना, या कोड लिखना। देखें agent मूल्यांकन की रूपरेखा और एजेंटिक एनोटेशन संदर्भ।
AI agent के मूल्यांकन के स्तर कौन-कौन से हैं?
वही स्तर चुनें जो आपके सवाल से मेल खाता हो:
- Trajectory स्तर: पूरे रन को आँकें। क्या वह सफल रहा? क्या वह कार्यकुशल और सुरक्षित था? देखें Agent trajectory का एनोटेशन।
- चरण स्तर: हर कार्रवाई को आँकें। क्या यह tool call सही था? क्या यह चरण ज़रूरी था? Process reward model के पीछे यही डेटा होता है।
- Span स्तर: आउटपुट के भीतर की ख़ास दिक़्क़तें हाइलाइट करें, जैसे कोई गढ़ा हुआ दावा या असुरक्षित निर्देश। देखें Hallucination पकड़ना।
- तुलना स्तर: दो agent या दो रन को आमने-सामने रखकर आँकें। देखें जोड़ीवार मॉडल तुलना।
- टीम स्तर: बहु-agent प्रणालियों में किसी नाकामी को ज़िम्मेदार agent, चरण और handoff तक ले जाएँ। देखें बहु-agent प्रणालियों का मूल्यांकन कैसे करें।
Potato किन agent ट्रेस फ़ॉर्मैट का समर्थन करता है?
Potato 15 फ़ॉर्मैट से agent ट्रेस पढ़ता है, जिनमें OpenAI और Anthropic के tool call, ReAct, LangChain, LangFuse, WebArena, SWE-bench, MCP, और OpenTelemetry शामिल हैं, और उन्हें agent के किस्म के हिसाब से बने डिस्प्ले में दिखाता है:
- Agent trace display तर्क/tool ट्रेस के लिए।
- Web agent display स्क्रीनशॉट और कार्रवाई ओवरले के साथ, देखें Web-agent का मूल्यांकन।
- Coding trace display diff और टर्मिनल आउटपुट के साथ, देखें Coding-agent का मूल्यांकन।
- Live agent display किसी agent को असल समय में देखने और मोड़ने के लिए, देखें Live agent का मूल्यांकन।
- Multimodal agent display computer-use, आवाज़ और वीडियो agent के लिए, देखें Computer-use और multimodal agent का मूल्यांकन।
Agent मूल्यांकन का कौन-सा तरीक़ा चुनूँ?
| आपका सवाल | तरीक़ा |
|---|---|
| “क्या agent ने कार्य पूरा किया?” | Trajectory सफलता लेबल |
| “ग़लती ठीक कहाँ हुई?” | चरण-स्तर की एरर वर्गीकरण सूची |
| “कौन-सा संस्करण बेहतर है?” | जोड़ीवार तुलना |
| “कई पहलुओं पर यह कितना अच्छा है?” | रूब्रिक मूल्यांकन |
| “क्या retrieved-context वाला जवाब स्रोत के प्रति वफ़ादार है?” | RAG मूल्यांकन |
| “टीम के किस agent से नाकामी हुई?” | बहु-agent ज़िम्मेदारी तय करना |
| “क्या computer-use agent ने सही जगह क्लिक किया?” | GUI trajectory समीक्षा |