Skip to content

Live agent का मूल्यांकन

Potato के live agent display से किसी AI agent को असल समय में कैसे आँकें, उसे रोकें, निर्देश भेजें, कमान अपने हाथ में लें, पीछे लौटें और दूसरा रास्ता आज़माएँ।

Agent का मूल्यांकन ज़्यादातर किसी रिकॉर्ड की गई ट्रेस को देखकर होता है। Live मूल्यांकन में agent को चलते हुए देखा जाता है और बीच में इंसान दख़ल दे सकता है, यानी उसे रोक सकता है, निर्देश भेज सकता है, कमान अपने हाथ में ले सकता है, या किसी पिछले चरण पर लौटकर दूसरा रास्ता आज़मा सकता है। अपने ही सर्वर पर human-in-the-loop agent मूल्यांकन के लिए Potato एक ओपन-सोर्स टूल है, जो वह पकड़ लेता है जो रिकॉर्डिंग से नहीं मिलता: वह जगह जहाँ कोई इंसान दख़ल देता, और बेहतर मार्गदर्शन दिखता कैसा है।

फ़ीचर संदर्भ के लिए लाइव एजेंट मूल्यांकन और Live Coding Agent देखें।

Live agent मूल्यांकन से क्या जुड़ता है?

  • रोकना और फिर चलाना: कार्य के बीच में agent को रोककर उसकी स्थिति देखें।
  • निर्देश भेजना: उसे कोई सलाह देकर देखें कि वह उसके हिसाब से कैसे बदलता है।
  • कमान लेना: ख़ुद चलाएँ, फिर नियंत्रण वापस सौंप दें। ये सौंपने-लेने के मौक़े अपने आप में क़ीमती लेबल हैं।
  • पीछे लौटना और शाखा बनाना: किसी पिछले चरण पर लौटकर दूसरा विकल्प आज़माएँ और एक ही स्थिति से निकले दोनों रास्तों की तुलना करें।

इससे हस्तक्षेप वाला डेटा बनता है, यानी क्या मदद करता है इस पर counterfactual, न कि सिर्फ़ देखकर लगाए गए लेबल।

Potato में live agent मूल्यांकन कैसे सेट करूँ?

Live मोड में Potato किसी endpoint के ज़रिए चल रहे agent से जुड़ता है (OpenAI-अनुरूप proxy, अपना कोई HTTP endpoint, या कोई coding-agent backend)। एनोटेटर live agent display से बातचीत करता है।

yaml
live_agent:
  endpoint_type: anthropic_vision   # or coding_agent, openai_proxy, ...
  ai_config:
    model: claude-sonnet-4-20250514
    api_key: ${ANTHROPIC_API_KEY}
  max_steps: 30
  allow_takeover: true
  allow_instructions: true

Live agent मूल्यांकन कब करूँ?

  • दिशानिर्देश बनाते समय: चलते हुए देखने पर वे नाकामियाँ सामने आती हैं जिन्हें बाद की बैच लेबलिंग के लिए वर्गीकरण सूची में दर्ज करना सार्थक है।
  • संवाद वाले कार्यों में: chat सहायक और tool चलाने वाले agent, जहाँ आप सिर्फ़ transcript नहीं, बातचीत को आँक रहे होते हैं।
  • दबाव में परखने के लिए: यह देखना कि एक टहोके या ज़बरदस्ती के चक्कर के बाद agent कैसे सँभलता है।

रिकॉर्ड की गई ट्रेस देखने के मुक़ाबले live मूल्यांकन में मेहनत ज़्यादा लगती है और रफ़्तार कम रहती है, इसलिए यह किसी छोटे चुने हुए नमूने के लिए या बैच कार्य की रूपरेखा बनाने के लिए सबसे ठीक है। बड़ी मात्रा के लिए रिकॉर्ड किए गए रन पर trajectory एनोटेशन पर चले जाएँ।

आगे पढ़ें