كيف تحصل على تصنيفات موثوقة لمسارات الوكلاء
تعليق أثر متعدد الخطوات لوكيل أصعب من تصنيف تغريدة. دليل لتصميم التصنيف الهرمي، وقياس الاتفاق على مستوى الخطوة، والبتّ في الاختلاف، مع إعداد Potato.
تصنيف تغريدة قرار واحد. أما تصنيف مسار وكيل فعشرات القرارات: كل خطوة في التشغيلة حكم صغير، والأحكام يتوقف بعضها على بعض. سيتفق شخصان متأنّيان عادةً على ما إذا نجحت التشغيلة، ثم يختلفان على أيّ من خطواتها الاثنتي عشرة هي التي أخطأت. وإن لم تصمّم للتعامل مع هذه الفجوة، فبيانات المسارات "المصنَّفة" لديك غير موثوقة، ونموذج المكافأة أو تحليل تصحيح الأخطاء الذي تبنيه عليها يرث الضوضاء.
المسار هو الأثر الكامل لتشغيلة وكيل: هدفه، ثم استدلال كل خطوة واستدعاء أداتها وملاحظتها. تعليق مسار يعني الحكم على التشغيلة إجمالًا وتحديد أين أخطأت الخطوات المفردة. الاتفاق على تصنيف التشغيلة ككل سهل؛ أما التصنيفات على مستوى الخطوة فليست كذلك، وهي بالضبط ما يحتاجه نموذج المكافأة أو تحليل تصحيح الأخطاء. بيانات المسارات الموثوقة تأتي من تصنيف هرمي محكم للأخطاء، ومن قياس الاتفاق لكل خطوة عن قصد، ومن طريقة لحسم الاختلاف.
ما الذي يجعل المسار صعب التعليق
الخطوات ليست مستقلة، وهذا يهمّ أكثر من عددها.
- إسناد الخطأ. حين تفشل تشغيلة، يكون الفشل الظاهر غالبًا بعد عدة خطوات من الخطأ الحقيقي. وضع الوكيل خطة سيئة في الخطوة 3، وظهر ذلك إجابةً خاطئة في الخطوة 11. يمكن لمُعلّقَين يشاهدان التشغيلة نفسها أن يكونا محقَّين معًا في أن "هذه الخطوة خاطئة" بينما يختلفان على أي خطوة تُلام.
- الآثار المتتالية. ما إن تخطئ خطوة حتى يتلوّث كل ما بعدها. فهل الخطوة اللاحقة "خاطئة" بذاتها، أم خاطئة فقط لأنها ورثت حالة سيئة؟ يحتاج المُعلّقون قاعدة لهذا وإلا انقسموا.
- حالة خفية. استدلال الوكيل ليس دائمًا موجودًا في الأثر، ولأدواته آثار جانبية لا تراها. يعالج τ-bench (Yao وآخرون، 2024) هذا بفحص حالة قاعدة البيانات في نهاية التشغيلة مقابل حالة هدف مُعلَّقة، لأنك كثيرًا ما لا تستطيع الحكم على الصحة من النص وحده.
- "الضرورة" الذاتية. كون الخطوة غير ضرورية بدلًا من كونها خاطئة حكم تقديري، وهو من أقل التصنيفات موثوقية عمليًّا. البحث المكرر ليس خطأً، لكنه ليس نظيفًا أيضًا.
صمّم التصنيف الهرمي قبل أن تصنّف
تصنيفك الهرمي هو ما يحدد جودة بياناتك، ومجموعات بيانات إخفاقات الوكلاء التي نجحت بُنيت بمنهج التصنيف أولًا. خرج MAST، التصنيف الهرمي لإخفاقات الأنظمة متعددة الوكلاء (Cemri وآخرون، 2025) من مُعلّقين خبراء درسوا 150 أثرًا، وكرّروا على الفئات حتى بلغوا كابا لكوهين عند 0.88، وعندها فقط توسّعوا إلى ما يزيد على 1600 أثر عبر أنماط الإخفاق الأربعة عشر فيه. الموثوقية جاءت من العمل على التصنيف الهرمي، لا من زيادة عدد المُعلّقين.
المسار هو هدف وسلسلة خطوات من فكرة-فعل-ملاحظة ونتيجة، وكل خطوة تحمل تصنيفاتها
التصنيف الهرمي العملي صغير، ويقارب الشمول، وفئاته يستبعد بعضها بعضًا. ثلاث فئات عليا تغطي معظم إخفاقات الوكلاء:
- أخطاء الاستدلال: استنتاج خاطئ، أو أدلة مُهمَلة، أو خطة سيئة.
- أخطاء التنفيذ: الأداة الخاطئة، أو استدعاء مشوّه، أو نتيجة أُسيء التعامل معها.
- أخطاء السلامة: فعل غير آمن، أو سلوك خارج النطاق، أو كشف بيانات.
امنح المُعلّقين خانة "أخرى" بنص حر حتى يكون للإخفاق الجديد موضع يذهب إليه بدل حشره في أقرب فئة، ثم راقب ملاحظات "أخرى" وارفع المتكرر منها إلى فئات مُسمّاة. وAgentRewardBench (Lù وآخرون، 2025) نموذج مفيد لما ينبغي التقاطه على مستوى التشغيلة: حكم مراجعوه الخبراء على كل مسار من 1302 مسارًا من حيث النجاح والآثار الجانبية والتكرار، وهي ثلاثة محاور كانت راية نجاح واحدة ستطويها في واحد.
تصنيف هرمي صغير تستبعد فئاته بعضها بعضًا مع مخرج للإخفاقات الجديدة
قياس الاتفاق على التصنيفات متعددة الخطوات
النجاح الإجمالي هو التصنيف السهل. يشاهد شخصان تشغيلة ويتفقان غالبًا على أنها نجحت أو لم تنجح. وإن كان هذا هو الرقم الوحيد الذي تبلّغ عنه، فبياناتك تبدو أكثر موثوقية مما هي عليه.
قِس الاتفاق حيث يكون صعبًا فعلًا. احسب اتفاق المُعلّقين بشكل منفصل لصحة الخطوة ولفئة الخطأ، لأنهما يسلكان سلوكًا مختلفًا: يتفق الناس على ما إذا كانت خطوة خاطئة أكثر بكثير من اتفاقهم على لماذا. وقارِن تحديدات أول خطوة خاطئة بين المُعلّقين، إذ إن تلك الخطوة الواحدة هي الأهمّ في تدريب نموذج مكافأة إجرائي، بالمعنى الوارد في PRM800K / "Let's Verify Step by Step" (Lightman وآخرون، 2023). وتعامل مع التقييم الآلي بارتياب: وجد AgentRewardBench أن الفحوص القائمة على القواعد التي تعتمد عليها المعايير الشائعة تميل إلى التقليل من نجاح الوكلاء، فالتصنيف الآلي الرخيص ليس بديلًا عن البشري، بل مجرد جولة أولى.
البتّ في الاختلاف وتأهيل المُعلّقين
الاختلاف على المسارات يعني عادةً أن التصنيف الهرمي غير محدد بدقة في موضع ما، لا أن مُعلّقًا زلّ. فحين ينقسم مُعلّقان على أي خطوة تُلام، يخبرك هذا الزوج من التصنيفات أن قاعدة التتالي غير محددة بدقة، والعلاج يعود إلى الإرشادات.
ممارستان تحملان معظم الثقل. أولًا، ابتّ في الاختلافات بدل التصويت عليها، لأن الحوار حول "لماذا اخترت تلك الخطوة" هو موضع كتابة القاعدة الحقيقية في المسارات؛ انظر البتّ وحسم الاختلاف. ثانيًا، أهّل المُعلّقين على الآثار الطويلة تدريجيًّا. المسارات مُتعِبة، والمُعلّق المرهق عند الخطوة 40 ليس الأداة نفسها التي كان عليها وهو نشيط عند الخطوة 2. حُدّ من طول التشغيلات الطويلة أو قسّمها إلى صفحات، وعايِر الجميع على مجموعة آثار مشتركة قبل أن يعملوا باستقلال.
كيف تفعل ذلك في Potato
يعرض نوع trajectory_eval في Potato كل خطوة على شكل بطاقة ويلحق بها تصنيفًا هرميًّا للأخطاء لكل خطوة مع أوزان خطورة، فتعيش التصنيفات المذكورة أعلاه داخل الإعداد.
annotation_schemes:
- annotation_type: trajectory_eval
name: step_evaluation
description: "Evaluate each step for correctness and mark any errors."
steps_key: steps
error_types:
- {name: reasoning, subtypes: [logical_error, factual_error, planning_error]}
- {name: execution, subtypes: [wrong_tool, wrong_args, api_error]}
- {name: safety, subtypes: [harmful_action, data_leak, scope_violation]}
severities:
- {name: minor, weight: -1}
- {name: major, weight: -5}
- {name: critical, weight: -10}
show_score: trueتتجمع أوزان الخطورة في درجة للمسار، فيمكنك ترتيب التشغيلات وتتبّع الانحدارات عبر إصدارات النماذج. وحين يكون الهدف تحديدًا أول خطوة خاطئة لتدريب نموذج مكافأة، ففي نوع process_reward وضع أول-خطأ مبني لهذا الغرض. ويستورد Potato الآثار من 15 صيغة إلى عرض خطوات موحّد، فتستطيع تعليق تشغيلة أيًّا كان الإطار الذي أنتجها؛ انظر التعليق الوكيلي.
قراءات إضافية
- تعليق مسارات الوكلاء، المرجع التفصيلي للميزة خطوة بخطوة.
- نماذج المكافأة الإجرائية والتصنيف على مستوى الخطوة، لبيانات أول-خطأ والمكافأة لكل خطوة.
- تقييم استخدام الأدوات واستدعاء الدوال، للحكم على استدعاءات الأدوات المفردة.
- شرح اتفاق المُعلّقين، لإحصاءات الموثوقية التي يقوم عليها هذا كله.
صفحات المعرض المبنية على معايير وكلاء حقيقية تعرض المخططات في سياقها: WebArena وτ-bench وAgentRewardBench.