Skip to content

مجموعات البيانات والتجارب

ابنِ مجموعات بيانات تقييم مُدارة الإصدارات وشغّل تجارب تُقيِّم مخرجات الوكلاء عبر الزمن. العمود الفقري للتقييم في Potato — تخزين بالملفات أو SQLite، وإصدارات موسومة، وتقسيمات، وتصدير SFT/DPO، ومقارنة تجارب جنبًا إلى جنب مع فروق التراجع.

مجموعات البيانات والتجارب هما العمود الفقري للتقييم في Potato: مجموعات مُدارة الإصدارات من أمثلة التقييم، وتشغيلات تجارب تُقيِّمها بـالمُقيِّمات البرمجية. معًا يحوّلان Potato من «علِّق مرة واحدة» إلى «قيِّم باستمرار»: انتقِ مجموعة اختبار، وشغّل المُقيِّمات، وتتبّع الدرجات عبر إصدارات الموجّهات أو النماذج.

التفعيل

yaml
datasets:
  enabled: true
  storage: file   # "file" (default, git-diffable JSONL) | "sqlite"

مجموعات البيانات

مجموعة البيانات هي مجموعة مسماة من الأمثلة (id وinputs وreference_outputs اختياريًا وmetadata وsplit). كل إضافة/تحديث/حذف يُنشئ إصدارًا جديدًا غير قابل للتغيير (v0001، v0002، …)؛ ويمكن وسم الإصدارات (مثل prod)، وتثبّت القراءات إصدارًا محددًا عبر as_of (إما latest أو وسم أو معرّف إصدار).

انتقِ الأمثلة بثلاث طرق:

  • من المهمة الحية — يحوّل Import loaded instances حالات المهمة المحمَّلة إلى أمثلة.
  • من المسارات المستوعبة فقطImport ingested traces (عبر webhook / LangSmith / Langfuse).
  • بالتعليقات البشرية مراجعَ — تجميع تسمية الأغلبية البشرية لكل مخطط داخل reference_outputs الخاصة بكل مثال.

التجارب

تشغّل التجربة مُقيِّمات على إصدار من مجموعة بيانات وتسجّل نتائج كل مثال إضافة إلى الدرجات المجمَّعة. اختر مجموعة بيانات ومُقيِّمات في صفحة النظرة العامة ثم اضغط Run، أو استخدم POST /datasets/api/experiments/run. حدّد تجربتين أو أكثر ثم اضغط Compare لعرض الدرجات المجمَّعة جنبًا إلى جنب، مع الفروق مقابل خط الأساس حتى تبرز التراجعات.

تستدعي مُقيِّمات الحكم بواسطة LLM نقطة نهاية الذكاء الاصطناعي المضبوطة لديك، وقد تستغرق وقتًا على مجموعات البيانات الكبيرة.

التصدير إلى بيانات الضبط الدقيق

يُصدَّر أي إصدار من مجموعة بيانات إلى JSONL للضبط الدقيق:

  • SFT{"prompt": <inputs>, "completion": <reference_outputs>}
  • DPO{"prompt": <inputs>, "chosen": <reference_outputs>, "rejected": <metadata.rejected | outputs>}
bash
curl -OJ "http://localhost:8000/datasets/api/datasets/agent-eval-v1/export?format=sft"

واجهة API

تتطلب جميع نقاط النهاية مصادقة مشرف (ترويسة X-API-Key أو جلسة مشرف).

الطريقةالمسارالغرض
POST/datasets/api/datasetsإنشاء مجموعة بيانات
POST/datasets/api/datasets/<name>/examplesإضافة أمثلة (إصدار جديد)
POST/datasets/api/datasets/<name>/tagوسم إصدار
GET/datasets/api/datasets/<name>/export?format=sft|dpoتصدير JSONL
POST/datasets/api/experiments/runتشغيل تجربة
GET/datasets/api/experimentsسرد التجارب

تفحص واجهة إدارة التقييم (/admin/eval/...) عملية التعليق لهذه المهام وتتحكم فيها: حالة مجموعات البيانات/التجارب، وتقدّم التعليق لكل حالة، وأعداد المسارات المستوعبة، وإيقاف الإسناد مؤقتًا واستئنافه.

مواضيع ذات صلة