Skip to content

تقييم الوكلاء

تقييم مخرجات الوكلاء بواسطة البشر ونماذج التحكيم: معايرة المحكّم، ومراجعة الآثار، وتحرير المسارات، والمقيّمات البرمجية، والتقييم في التكامل المستمر.

يتعامل هذا القسم مع مخرجات النموذج بوصفها شيئًا يُراجَع لا شيئًا يُوصَّف. ووحدة العمل غالبًا أثر: تشغيلة واحدة لوكيل، بما فيها استدعاءات الأدوات والخطوات الوسيطة والإجابة النهائية.

يغطي معايرة نموذج LLM بوصفه حَكَمًا وتوافق المُحكِّم ↔ البشر الحالة التي يتولى فيها نموذج التقييم وتحتاج أنت إلى معرفة حدود الثقة به. ويغطي تقييم المسار بثلاثة أجزاء (eval_trace) الحالة التي يتولاها فيها إنسان. ويغطي التقييم في CI تشغيل أيٍّ منهما مع كل إيداع.

لا يدرّب Potato نماذج. كل ما هنا ينتج تسميات ودرجات وإحصاءات اتفاق؛ وما تفعله بها بعد ذلك يجري خارج الأداة.