Skip to content

डेटासेट और प्रयोग

संस्करणबद्ध मूल्यांकन डेटासेट बनाएँ और ऐसे प्रयोग चलाएँ जो समय के साथ एजेंट आउटपुट को स्कोर करें। Potato की eval रीढ़ — फ़ाइल या SQLite संग्रहण, टैग किए गए संस्करण, स्प्लिट, SFT/DPO निर्यात, और रिग्रेशन डेल्टा के साथ प्रयोगों की आमने-सामने तुलना।

डेटासेट और प्रयोग Potato की मूल्यांकन रीढ़ हैं: मूल्यांकन उदाहरणों के संस्करणबद्ध संग्रह, और प्रयोग रन जो उन्हें प्रोग्रामेटिक इवैल्यूएटरों से स्कोर करते हैं। मिलकर ये Potato को "एक बार एनोटेट करो" से "निरंतर मूल्यांकन करो" में बदल देते हैं: एक टेस्ट सेट संकलित करें, इवैल्यूएटर चलाएँ, और प्रॉम्प्ट या मॉडल संस्करणों के बीच स्कोर पर नज़र रखें।

सक्रिय करना

yaml
datasets:
  enabled: true
  storage: file   # "file" (default, git-diffable JSONL) | "sqlite"

डेटासेट

डेटासेट उदाहरणों का एक नामित संग्रह है (id, inputs, वैकल्पिक reference_outputs, metadata, split)। हर जोड़ने/अद्यतन/हटाने की क्रिया एक नया अपरिवर्तनीय संस्करण बनाती है (v0001, v0002, …); संस्करणों को टैग किया जा सकता है (जैसे prod), और पढ़ते समय as_of से कोई संस्करण पिन किया जाता है (latest, कोई टैग, या संस्करण id)।

उदाहरण तीन तरीक़ों से संकलित करें:

  • लाइव टास्क सेImport loaded instances टास्क की इंस्टेंसों को उदाहरणों में बदल देता है।
  • केवल ग्रहण की गई ट्रेस सेImport ingested traces (webhook / LangSmith / Langfuse)।
  • मानव एनोटेशनों को संदर्भ बनाकर — प्रति योजना बहुमत वाले मानव लेबल को समेकित करके हर उदाहरण के reference_outputs में डालें।

प्रयोग

एक प्रयोग किसी डेटासेट संस्करण पर इवैल्यूएटर चलाता है और प्रति-उदाहरण परिणामों के साथ समग्र स्कोर दर्ज करता है। ओवरव्यू पेज पर डेटासेट और इवैल्यूएटर चुनकर Run दबाएँ, या POST /datasets/api/experiments/run करें। दो या अधिक प्रयोग चुनकर Compare करें ताकि समग्र स्कोर आमने-सामने दिखें, बेसलाइन के सापेक्ष डेल्टा के साथ, जिससे रिग्रेशन तुरंत नज़र में आ जाएँ।

LLM-judge इवैल्यूएटर आपके कॉन्फ़िगर किए गए AI एंडपॉइंट को कॉल करते हैं और बड़े डेटासेटों पर समय ले सकते हैं।

फ़ाइन-ट्यूनिंग डेटा में निर्यात

कोई भी डेटासेट संस्करण फ़ाइन-ट्यूनिंग के लिए JSONL में निर्यात होता है:

  • SFT{"prompt": <inputs>, "completion": <reference_outputs>}
  • DPO{"prompt": <inputs>, "chosen": <reference_outputs>, "rejected": <metadata.rejected | outputs>}
bash
curl -OJ "http://localhost:8000/datasets/api/datasets/agent-eval-v1/export?format=sft"

API

सभी एंडपॉइंट के लिए एडमिन प्रमाणीकरण आवश्यक है (X-API-Key हेडर या एडमिन सत्र)।

मेथडपथउद्देश्य
POST/datasets/api/datasetsडेटासेट बनाएँ
POST/datasets/api/datasets/<name>/examplesउदाहरण जोड़ें (नया संस्करण)
POST/datasets/api/datasets/<name>/tagकिसी संस्करण को टैग करें
GET/datasets/api/datasets/<name>/export?format=sft|dpoJSONL निर्यात करें
POST/datasets/api/experiments/runप्रयोग चलाएँ
GET/datasets/api/experimentsप्रयोगों की सूची देखें

Eval-admin API (/admin/eval/...) इन कार्यों की एनोटेशन प्रक्रिया का निरीक्षण और नियंत्रण करता है: डेटासेट/प्रयोग स्थिति, प्रति-इंस्टेंस एनोटेशन प्रगति, ग्रहण की गई ट्रेस की गिनती, और असाइनमेंट का रोकना/फिर शुरू करना।

संबंधित