टूल उपयोग और function calling का मूल्यांकन
किसी agent के tool call और function calling को अलग-अलग ट्रेस फ़ॉर्मैट (OpenAI, Anthropic, ReAct, LangChain) में Potato की प्रति-चरण रेटिंग से कैसे एनोटेट और आँकें।
जब कोई agent tool चलाता है, चाहे वह सर्च हो, कैलकुलेटर, कोई API या डेटाबेस, तब हर call एक फ़ैसला होता है जिसे आँका जा सकता है: क्या यही सही tool था? क्या argument ठीक थे? क्या नतीजे का सही इस्तेमाल हुआ? Tool-use मूल्यांकन इन फ़ैसलों को agent के ट्रेस पर प्रति-चरण लेबल में बदल देता है।
यह अपने-आप चलने वाले function calling benchmark का पूरक है, जहाँ इंसान की परख काम आती है: कोई call वाक्य-रचना के लिहाज़ से सही हो सकता है और फिर भी कार्य के लिहाज़ से ग़लत।
हर tool call पर क्या आँकें
- Tool का चुनाव: क्या यही सही tool था, या कोई दूसरा (या कोई भी नहीं) चलाना चाहिए था?
- Argument: क्या parameter सही और पूरे थे?
- ज़रूरत: क्या यह call ज़रूरी था, या दोहराव भर था?
- नतीजे का इस्तेमाल: क्या agent ने आउटपुट को ठीक से समझा और बरता?
किसी भी framework का ट्रेस पढ़ना
Potato 15 ट्रेस फ़ॉर्मैट को एक साझा चरण-दृश्य में बदल देता है, इसलिए agent चाहे जिस तरह बना हो, tool उपयोग आँका जा सकता है: OpenAI और Anthropic के tool/function call, ReAct के thought-action-observation ट्रेस, LangChain, LangFuse, और बाक़ी। देखें एजेंटिक एनोटेशन।
प्रति-चरण रेटिंग की सेटिंग
हर चरण (यानी हर tool call) के साथ एक रेटिंग जोड़िए, और नाकाम मामलों के लिए एक शर्तिया फ़ॉलो-अप:
annotation_schemes:
- annotation_type: trajectory_eval
name: tool_call_correctness
description: "For each tool call, judge whether it was the right call."
steps_key: agentic_steps
correctness_options: ["Correct", "Wrong tool", "Wrong arguments", "Unnecessary"]
- annotation_type: text
name: notes
description: "If not correct, what should it have done?"
label_requirement:
required: falseगुणवत्ता से जुड़ी बातें
- सिर्फ़ call नहीं, tool का आउटपुट भी दिखाइए, वरना एनोटेटर यह परख ही नहीं सकते कि नतीजे का इस्तेमाल कैसा रहा।
- JSON argument और response को pretty-print कीजिए ताकि वे पढ़े जा सकें (Potato agent trace display में यह ख़ुद करता है)।
- “ग़लत tool” और “सही tool, ग़लत argument” को अलग रखिए, दोनों मॉडल में अलग-अलग सुधार की ओर इशारा करते हैं।
आगे पढ़ें
- Agent trajectory पर भरोसेमंद लेबल कैसे पाएँ, बहु-चरण ट्रेस पर सहमति मापने के बारे में।
- AI agent का मूल्यांकन कैसे करें
- Agent trajectory का एनोटेशन
- Agentic Annotation फ़ीचर संदर्भ