Skip to content

Coding-Agent का मूल्यांकन

Coding agent का मूल्यांकन कैसे करें, diff, टर्मिनल आउटपुट, और SWE-bench/Aider/Claude Code ट्रेस की समीक्षा, Potato के coding trace डिस्प्ले के साथ।

कोई coding agent फ़ाइलें संपादित करता है, कमांड चलाता है, और आउटपुट पढ़कर कोई प्रोग्रामिंग कार्य हल करता है। उसका मूल्यांकन ऐसे pull request की समीक्षा जैसा है जिसमें टर्मिनल सेशन भी शामिल हो: आप कोड में हुए बदलाव और उन तक पहुँचाने वाले चरण, दोनों आँकते हैं। SWE-agent, Aider, और Claude Code trajectory को Potato से एनोटेट करें, यह मुफ़्त, स्वयं-होस्ट किया जाने वाला टूल समीक्षा के लिए diff और टर्मिनल ब्लॉक दिखाता है।

यह SWE-bench जैसे स्वचालित बेंचमार्क के साथ चलता है; इंसानी समीक्षा उस patch को पकड़ लेती है जो देखने में ठीक लगता है पर ग़लत है और किसी कमज़ोर टेस्ट से पास हो जाता है।

Coding-agent के रन में एनोटेटर क्या देखता है?

  • Diff: हर फ़ाइल बदलाव का रंगों में unified diff, लाइन नंबर और फ़ाइल-ट्री साइडबार के साथ।
  • कमांड और आउटपुट: टर्मिनल ब्लॉक, जो दिखाते हैं कि agent ने क्या चलाया और जवाब में क्या आया।
  • तर्क: कार्रवाइयों के बीच agent के विचार।

Potato coding-agent ट्रेस पढ़ता है, जिनमें SWE-bench, Aider, और Claude Code फ़ॉर्मैट शामिल हैं। देखें कोडिंग एजेंट एनोटेशन और कोड रिव्यू एनोटेशन

Coding-agent के रन में मुझे क्या आँकना चाहिए?

  • सहीपन: क्या बदलाव कार्य को हल करता है, बिना कुछ और तोड़े?
  • चरण की गुणवत्ता: हर संपादन या कमांड समझदारी भरा था, या बस हाथ-पाँव मारे जा रहे थे?
  • कार्यकुशलता: क्या उसने कोई वाजिब रास्ता लिया?
yaml
annotation_schemes:
  - annotation_type: trajectory_eval
    name: step_correctness
    description: "Judge each edit or command."
    steps_key: agentic_steps
    correctness_options: ["Correct", "Partially correct", "Incorrect", "Unnecessary"]
  - annotation_type: radio
    name: overall
    description: "Does the final change solve the task?"
    labels: [Solved, Partially solved, Not solved]

Coding-agent के मूल्यांकन को भरोसेमंद कैसे रखें?

  • एनोटेटर को कार्य का विवरण और रिपॉज़िटरी का संदर्भ दें; लक्ष्य जाने बिना diff का कोई मतलब नहीं।
  • पहली ग़लती तक पहुँचने वाली reasoning chain के लिए Process Reward Models देखें।
  • रिकॉर्डिंग की समीक्षा करने के बजाय agent को असल समय में कोड लिखते देखना हो, तो Live agent का मूल्यांकन देखें।

आगे पढ़ें