Coding-Agent का मूल्यांकन
Coding agent का मूल्यांकन कैसे करें, diff, टर्मिनल आउटपुट, और SWE-bench/Aider/Claude Code ट्रेस की समीक्षा, Potato के coding trace डिस्प्ले के साथ।
कोई coding agent फ़ाइलें संपादित करता है, कमांड चलाता है, और आउटपुट पढ़कर कोई प्रोग्रामिंग कार्य हल करता है। उसका मूल्यांकन ऐसे pull request की समीक्षा जैसा है जिसमें टर्मिनल सेशन भी शामिल हो: आप कोड में हुए बदलाव और उन तक पहुँचाने वाले चरण, दोनों आँकते हैं। SWE-agent, Aider, और Claude Code trajectory को Potato से एनोटेट करें, यह मुफ़्त, स्वयं-होस्ट किया जाने वाला टूल समीक्षा के लिए diff और टर्मिनल ब्लॉक दिखाता है।
यह SWE-bench जैसे स्वचालित बेंचमार्क के साथ चलता है; इंसानी समीक्षा उस patch को पकड़ लेती है जो देखने में ठीक लगता है पर ग़लत है और किसी कमज़ोर टेस्ट से पास हो जाता है।
Coding-agent के रन में एनोटेटर क्या देखता है?
- Diff: हर फ़ाइल बदलाव का रंगों में unified diff, लाइन नंबर और फ़ाइल-ट्री साइडबार के साथ।
- कमांड और आउटपुट: टर्मिनल ब्लॉक, जो दिखाते हैं कि agent ने क्या चलाया और जवाब में क्या आया।
- तर्क: कार्रवाइयों के बीच agent के विचार।
Potato coding-agent ट्रेस पढ़ता है, जिनमें SWE-bench, Aider, और Claude Code फ़ॉर्मैट शामिल हैं। देखें कोडिंग एजेंट एनोटेशन और कोड रिव्यू एनोटेशन।
Coding-agent के रन में मुझे क्या आँकना चाहिए?
- सहीपन: क्या बदलाव कार्य को हल करता है, बिना कुछ और तोड़े?
- चरण की गुणवत्ता: हर संपादन या कमांड समझदारी भरा था, या बस हाथ-पाँव मारे जा रहे थे?
- कार्यकुशलता: क्या उसने कोई वाजिब रास्ता लिया?
annotation_schemes:
- annotation_type: trajectory_eval
name: step_correctness
description: "Judge each edit or command."
steps_key: agentic_steps
correctness_options: ["Correct", "Partially correct", "Incorrect", "Unnecessary"]
- annotation_type: radio
name: overall
description: "Does the final change solve the task?"
labels: [Solved, Partially solved, Not solved]Coding-agent के मूल्यांकन को भरोसेमंद कैसे रखें?
- एनोटेटर को कार्य का विवरण और रिपॉज़िटरी का संदर्भ दें; लक्ष्य जाने बिना diff का कोई मतलब नहीं।
- पहली ग़लती तक पहुँचने वाली reasoning chain के लिए Process Reward Models देखें।
- रिकॉर्डिंग की समीक्षा करने के बजाय agent को असल समय में कोड लिखते देखना हो, तो Live agent का मूल्यांकन देखें।