Live agent का मूल्यांकन
Potato के live agent display से किसी AI agent को असल समय में कैसे आँकें, उसे रोकें, निर्देश भेजें, कमान अपने हाथ में लें, पीछे लौटें और दूसरा रास्ता आज़माएँ।
Agent का मूल्यांकन ज़्यादातर किसी रिकॉर्ड की गई ट्रेस को देखकर होता है। Live मूल्यांकन में agent को चलते हुए देखा जाता है और बीच में इंसान दख़ल दे सकता है, यानी उसे रोक सकता है, निर्देश भेज सकता है, कमान अपने हाथ में ले सकता है, या किसी पिछले चरण पर लौटकर दूसरा रास्ता आज़मा सकता है। अपने ही सर्वर पर human-in-the-loop agent मूल्यांकन के लिए Potato एक ओपन-सोर्स टूल है, जो वह पकड़ लेता है जो रिकॉर्डिंग से नहीं मिलता: वह जगह जहाँ कोई इंसान दख़ल देता, और बेहतर मार्गदर्शन दिखता कैसा है।
फ़ीचर संदर्भ के लिए लाइव एजेंट मूल्यांकन और Live Coding Agent देखें।
Live agent मूल्यांकन से क्या जुड़ता है?
- रोकना और फिर चलाना: कार्य के बीच में agent को रोककर उसकी स्थिति देखें।
- निर्देश भेजना: उसे कोई सलाह देकर देखें कि वह उसके हिसाब से कैसे बदलता है।
- कमान लेना: ख़ुद चलाएँ, फिर नियंत्रण वापस सौंप दें। ये सौंपने-लेने के मौक़े अपने आप में क़ीमती लेबल हैं।
- पीछे लौटना और शाखा बनाना: किसी पिछले चरण पर लौटकर दूसरा विकल्प आज़माएँ और एक ही स्थिति से निकले दोनों रास्तों की तुलना करें।
इससे हस्तक्षेप वाला डेटा बनता है, यानी क्या मदद करता है इस पर counterfactual, न कि सिर्फ़ देखकर लगाए गए लेबल।
Potato में live agent मूल्यांकन कैसे सेट करूँ?
Live मोड में Potato किसी endpoint के ज़रिए चल रहे agent से जुड़ता है (OpenAI-अनुरूप proxy, अपना कोई HTTP endpoint, या कोई coding-agent backend)। एनोटेटर live agent display से बातचीत करता है।
live_agent:
endpoint_type: anthropic_vision # or coding_agent, openai_proxy, ...
ai_config:
model: claude-sonnet-4-20250514
api_key: ${ANTHROPIC_API_KEY}
max_steps: 30
allow_takeover: true
allow_instructions: trueLive agent मूल्यांकन कब करूँ?
- दिशानिर्देश बनाते समय: चलते हुए देखने पर वे नाकामियाँ सामने आती हैं जिन्हें बाद की बैच लेबलिंग के लिए वर्गीकरण सूची में दर्ज करना सार्थक है।
- संवाद वाले कार्यों में: chat सहायक और tool चलाने वाले agent, जहाँ आप सिर्फ़ transcript नहीं, बातचीत को आँक रहे होते हैं।
- दबाव में परखने के लिए: यह देखना कि एक टहोके या ज़बरदस्ती के चक्कर के बाद agent कैसे सँभलता है।
रिकॉर्ड की गई ट्रेस देखने के मुक़ाबले live मूल्यांकन में मेहनत ज़्यादा लगती है और रफ़्तार कम रहती है, इसलिए यह किसी छोटे चुने हुए नमूने के लिए या बैच कार्य की रूपरेखा बनाने के लिए सबसे ठीक है। बड़ी मात्रा के लिए रिकॉर्ड किए गए रन पर trajectory एनोटेशन पर चले जाएँ।