डेटासेट और प्रयोग
संस्करणबद्ध मूल्यांकन डेटासेट बनाएँ और ऐसे प्रयोग चलाएँ जो समय के साथ एजेंट आउटपुट को स्कोर करें। Potato की eval रीढ़ — फ़ाइल या SQLite संग्रहण, टैग किए गए संस्करण, स्प्लिट, SFT/DPO निर्यात, और रिग्रेशन डेल्टा के साथ प्रयोगों की आमने-सामने तुलना।
डेटासेट और प्रयोग Potato की मूल्यांकन रीढ़ हैं: मूल्यांकन उदाहरणों के संस्करणबद्ध संग्रह, और प्रयोग रन जो उन्हें प्रोग्रामेटिक इवैल्यूएटरों से स्कोर करते हैं। मिलकर ये Potato को "एक बार एनोटेट करो" से "निरंतर मूल्यांकन करो" में बदल देते हैं: एक टेस्ट सेट संकलित करें, इवैल्यूएटर चलाएँ, और प्रॉम्प्ट या मॉडल संस्करणों के बीच स्कोर पर नज़र रखें।
सक्रिय करना
datasets:
enabled: true
storage: file # "file" (default, git-diffable JSONL) | "sqlite"डेटासेट
डेटासेट उदाहरणों का एक नामित संग्रह है (id, inputs, वैकल्पिक reference_outputs, metadata, split)। हर जोड़ने/अद्यतन/हटाने की क्रिया एक नया अपरिवर्तनीय संस्करण बनाती है (v0001, v0002, …); संस्करणों को टैग किया जा सकता है (जैसे prod), और पढ़ते समय as_of से कोई संस्करण पिन किया जाता है (latest, कोई टैग, या संस्करण id)।
उदाहरण तीन तरीक़ों से संकलित करें:
- लाइव टास्क से — Import loaded instances टास्क की इंस्टेंसों को उदाहरणों में बदल देता है।
- केवल ग्रहण की गई ट्रेस से — Import ingested traces (webhook / LangSmith / Langfuse)।
- मानव एनोटेशनों को संदर्भ बनाकर — प्रति योजना बहुमत वाले मानव लेबल को समेकित करके हर उदाहरण के
reference_outputsमें डालें।
प्रयोग
एक प्रयोग किसी डेटासेट संस्करण पर इवैल्यूएटर चलाता है और प्रति-उदाहरण परिणामों के साथ समग्र स्कोर दर्ज करता है। ओवरव्यू पेज पर डेटासेट और इवैल्यूएटर चुनकर Run दबाएँ, या POST /datasets/api/experiments/run करें। दो या अधिक प्रयोग चुनकर Compare करें ताकि समग्र स्कोर आमने-सामने दिखें, बेसलाइन के सापेक्ष डेल्टा के साथ, जिससे रिग्रेशन तुरंत नज़र में आ जाएँ।
LLM-judge इवैल्यूएटर आपके कॉन्फ़िगर किए गए AI एंडपॉइंट को कॉल करते हैं और बड़े डेटासेटों पर समय ले सकते हैं।
फ़ाइन-ट्यूनिंग डेटा में निर्यात
कोई भी डेटासेट संस्करण फ़ाइन-ट्यूनिंग के लिए JSONL में निर्यात होता है:
- SFT —
{"prompt": <inputs>, "completion": <reference_outputs>} - DPO —
{"prompt": <inputs>, "chosen": <reference_outputs>, "rejected": <metadata.rejected | outputs>}
curl -OJ "http://localhost:8000/datasets/api/datasets/agent-eval-v1/export?format=sft"API
सभी एंडपॉइंट के लिए एडमिन प्रमाणीकरण आवश्यक है (X-API-Key हेडर या एडमिन सत्र)।
| मेथड | पथ | उद्देश्य |
|---|---|---|
| POST | /datasets/api/datasets | डेटासेट बनाएँ |
| POST | /datasets/api/datasets/<name>/examples | उदाहरण जोड़ें (नया संस्करण) |
| POST | /datasets/api/datasets/<name>/tag | किसी संस्करण को टैग करें |
| GET | /datasets/api/datasets/<name>/export?format=sft|dpo | JSONL निर्यात करें |
| POST | /datasets/api/experiments/run | प्रयोग चलाएँ |
| GET | /datasets/api/experiments | प्रयोगों की सूची देखें |
Eval-admin API (/admin/eval/...) इन कार्यों की एनोटेशन प्रक्रिया का निरीक्षण और नियंत्रण करता है: डेटासेट/प्रयोग स्थिति, प्रति-इंस्टेंस एनोटेशन प्रगति, ग्रहण की गई ट्रेस की गिनती, और असाइनमेंट का रोकना/फिर शुरू करना।
संबंधित
- Read the Docs पर पूर्ण संदर्भ — पूर्ण API और संग्रहण विवरण, संस्करण-अनुरूप
- प्रोग्रामेटिक इवैल्यूएटर
- ऑटोमेशन नियम — आने वाली ट्रेस को अपने आप डेटासेटों में संकलित करें
- सिमैंटिक क्यूरेशन — जोड़ने योग्य ट्रेस समानता से खोजें