مجموعات البيانات والتجارب
ابنِ مجموعات بيانات تقييم مُدارة الإصدارات وشغّل تجارب تُقيِّم مخرجات الوكلاء عبر الزمن. العمود الفقري للتقييم في Potato — تخزين بالملفات أو SQLite، وإصدارات موسومة، وتقسيمات، وتصدير SFT/DPO، ومقارنة تجارب جنبًا إلى جنب مع فروق التراجع.
مجموعات البيانات والتجارب هما العمود الفقري للتقييم في Potato: مجموعات مُدارة الإصدارات من أمثلة التقييم، وتشغيلات تجارب تُقيِّمها بـالمُقيِّمات البرمجية. معًا يحوّلان Potato من «علِّق مرة واحدة» إلى «قيِّم باستمرار»: انتقِ مجموعة اختبار، وشغّل المُقيِّمات، وتتبّع الدرجات عبر إصدارات الموجّهات أو النماذج.
التفعيل
datasets:
enabled: true
storage: file # "file" (default, git-diffable JSONL) | "sqlite"مجموعات البيانات
مجموعة البيانات هي مجموعة مسماة من الأمثلة (id وinputs وreference_outputs اختياريًا وmetadata وsplit). كل إضافة/تحديث/حذف يُنشئ إصدارًا جديدًا غير قابل للتغيير (v0001، v0002، …)؛ ويمكن وسم الإصدارات (مثل prod)، وتثبّت القراءات إصدارًا محددًا عبر as_of (إما latest أو وسم أو معرّف إصدار).
انتقِ الأمثلة بثلاث طرق:
- من المهمة الحية — يحوّل Import loaded instances حالات المهمة المحمَّلة إلى أمثلة.
- من المسارات المستوعبة فقط — Import ingested traces (عبر webhook / LangSmith / Langfuse).
- بالتعليقات البشرية مراجعَ — تجميع تسمية الأغلبية البشرية لكل مخطط داخل
reference_outputsالخاصة بكل مثال.
التجارب
تشغّل التجربة مُقيِّمات على إصدار من مجموعة بيانات وتسجّل نتائج كل مثال إضافة إلى الدرجات المجمَّعة. اختر مجموعة بيانات ومُقيِّمات في صفحة النظرة العامة ثم اضغط Run، أو استخدم POST /datasets/api/experiments/run. حدّد تجربتين أو أكثر ثم اضغط Compare لعرض الدرجات المجمَّعة جنبًا إلى جنب، مع الفروق مقابل خط الأساس حتى تبرز التراجعات.
تستدعي مُقيِّمات الحكم بواسطة LLM نقطة نهاية الذكاء الاصطناعي المضبوطة لديك، وقد تستغرق وقتًا على مجموعات البيانات الكبيرة.
التصدير إلى بيانات الضبط الدقيق
يُصدَّر أي إصدار من مجموعة بيانات إلى JSONL للضبط الدقيق:
- SFT —
{"prompt": <inputs>, "completion": <reference_outputs>} - DPO —
{"prompt": <inputs>, "chosen": <reference_outputs>, "rejected": <metadata.rejected | outputs>}
curl -OJ "http://localhost:8000/datasets/api/datasets/agent-eval-v1/export?format=sft"واجهة API
تتطلب جميع نقاط النهاية مصادقة مشرف (ترويسة X-API-Key أو جلسة مشرف).
| الطريقة | المسار | الغرض |
|---|---|---|
| POST | /datasets/api/datasets | إنشاء مجموعة بيانات |
| POST | /datasets/api/datasets/<name>/examples | إضافة أمثلة (إصدار جديد) |
| POST | /datasets/api/datasets/<name>/tag | وسم إصدار |
| GET | /datasets/api/datasets/<name>/export?format=sft|dpo | تصدير JSONL |
| POST | /datasets/api/experiments/run | تشغيل تجربة |
| GET | /datasets/api/experiments | سرد التجارب |
تفحص واجهة إدارة التقييم (/admin/eval/...) عملية التعليق لهذه المهام وتتحكم فيها: حالة مجموعات البيانات/التجارب، وتقدّم التعليق لكل حالة، وأعداد المسارات المستوعبة، وإيقاف الإسناد مؤقتًا واستئنافه.
مواضيع ذات صلة
- المرجع الكامل على Read the Docs — الواجهة الكاملة وتفاصيل التخزين، مطابق للإصدار
- المُقيِّمات البرمجية
- قواعد الأتمتة — ضمّ المسارات الواردة إلى مجموعات البيانات تلقائيًا
- الانتقاء الدلالي — العثور على مسارات لإضافتها حسب التشابه