Skip to content
Guides6 min read

كيف تحصل على تصنيفات موثوقة لمسارات الوكلاء

تعليق أثر متعدد الخطوات لوكيل أصعب من تصنيف تغريدة. دليل لتصميم التصنيف الهرمي، وقياس الاتفاق على مستوى الخطوة، والبتّ في الاختلاف، مع إعداد Potato.

Potato Team

تصنيف تغريدة قرار واحد. أما تصنيف مسار وكيل فعشرات القرارات: كل خطوة في التشغيلة حكم صغير، والأحكام يتوقف بعضها على بعض. سيتفق شخصان متأنّيان عادةً على ما إذا نجحت التشغيلة، ثم يختلفان على أيّ من خطواتها الاثنتي عشرة هي التي أخطأت. وإن لم تصمّم للتعامل مع هذه الفجوة، فبيانات المسارات "المصنَّفة" لديك غير موثوقة، ونموذج المكافأة أو تحليل تصحيح الأخطاء الذي تبنيه عليها يرث الضوضاء.

المسار هو الأثر الكامل لتشغيلة وكيل: هدفه، ثم استدلال كل خطوة واستدعاء أداتها وملاحظتها. تعليق مسار يعني الحكم على التشغيلة إجمالًا وتحديد أين أخطأت الخطوات المفردة. الاتفاق على تصنيف التشغيلة ككل سهل؛ أما التصنيفات على مستوى الخطوة فليست كذلك، وهي بالضبط ما يحتاجه نموذج المكافأة أو تحليل تصحيح الأخطاء. بيانات المسارات الموثوقة تأتي من تصنيف هرمي محكم للأخطاء، ومن قياس الاتفاق لكل خطوة عن قصد، ومن طريقة لحسم الاختلاف.

ما الذي يجعل المسار صعب التعليق

الخطوات ليست مستقلة، وهذا يهمّ أكثر من عددها.

  • إسناد الخطأ. حين تفشل تشغيلة، يكون الفشل الظاهر غالبًا بعد عدة خطوات من الخطأ الحقيقي. وضع الوكيل خطة سيئة في الخطوة 3، وظهر ذلك إجابةً خاطئة في الخطوة 11. يمكن لمُعلّقَين يشاهدان التشغيلة نفسها أن يكونا محقَّين معًا في أن "هذه الخطوة خاطئة" بينما يختلفان على أي خطوة تُلام.
  • الآثار المتتالية. ما إن تخطئ خطوة حتى يتلوّث كل ما بعدها. فهل الخطوة اللاحقة "خاطئة" بذاتها، أم خاطئة فقط لأنها ورثت حالة سيئة؟ يحتاج المُعلّقون قاعدة لهذا وإلا انقسموا.
  • حالة خفية. استدلال الوكيل ليس دائمًا موجودًا في الأثر، ولأدواته آثار جانبية لا تراها. يعالج τ-bench (Yao وآخرون، 2024) هذا بفحص حالة قاعدة البيانات في نهاية التشغيلة مقابل حالة هدف مُعلَّقة، لأنك كثيرًا ما لا تستطيع الحكم على الصحة من النص وحده.
  • "الضرورة" الذاتية. كون الخطوة غير ضرورية بدلًا من كونها خاطئة حكم تقديري، وهو من أقل التصنيفات موثوقية عمليًّا. البحث المكرر ليس خطأً، لكنه ليس نظيفًا أيضًا.

صمّم التصنيف الهرمي قبل أن تصنّف

تصنيفك الهرمي هو ما يحدد جودة بياناتك، ومجموعات بيانات إخفاقات الوكلاء التي نجحت بُنيت بمنهج التصنيف أولًا. خرج MAST، التصنيف الهرمي لإخفاقات الأنظمة متعددة الوكلاء (Cemri وآخرون، 2025) من مُعلّقين خبراء درسوا 150 أثرًا، وكرّروا على الفئات حتى بلغوا كابا لكوهين عند 0.88، وعندها فقط توسّعوا إلى ما يزيد على 1600 أثر عبر أنماط الإخفاق الأربعة عشر فيه. الموثوقية جاءت من العمل على التصنيف الهرمي، لا من زيادة عدد المُعلّقين.

تشريح مسار وكيل: هدف، ثم سلسلة خطوات لكل منها فكرة واستدعاء أداة وملاحظة، تنتهي بنتيجة، مع حكم لكل خطوة وفئة خطأ ودرجة خطورة فوقها.المسار هو هدف وسلسلة خطوات من فكرة-فعل-ملاحظة ونتيجة، وكل خطوة تحمل تصنيفاتها

التصنيف الهرمي العملي صغير، ويقارب الشمول، وفئاته يستبعد بعضها بعضًا. ثلاث فئات عليا تغطي معظم إخفاقات الوكلاء:

  • أخطاء الاستدلال: استنتاج خاطئ، أو أدلة مُهمَلة، أو خطة سيئة.
  • أخطاء التنفيذ: الأداة الخاطئة، أو استدعاء مشوّه، أو نتيجة أُسيء التعامل معها.
  • أخطاء السلامة: فعل غير آمن، أو سلوك خارج النطاق، أو كشف بيانات.

امنح المُعلّقين خانة "أخرى" بنص حر حتى يكون للإخفاق الجديد موضع يذهب إليه بدل حشره في أقرب فئة، ثم راقب ملاحظات "أخرى" وارفع المتكرر منها إلى فئات مُسمّاة. وAgentRewardBench (Lù وآخرون، 2025) نموذج مفيد لما ينبغي التقاطه على مستوى التشغيلة: حكم مراجعوه الخبراء على كل مسار من 1302 مسارًا من حيث النجاح والآثار الجانبية والتكرار، وهي ثلاثة محاور كانت راية نجاح واحدة ستطويها في واحد.

شجرة تصنيف هرمي لأخطاء الوكلاء: فئات الاستدلال والتنفيذ والسلامة، وكل منها ينقسم إلى أنواع فرعية مُسمّاة، مع فرع مفتوح للأخرى.تصنيف هرمي صغير تستبعد فئاته بعضها بعضًا مع مخرج للإخفاقات الجديدة

قياس الاتفاق على التصنيفات متعددة الخطوات

النجاح الإجمالي هو التصنيف السهل. يشاهد شخصان تشغيلة ويتفقان غالبًا على أنها نجحت أو لم تنجح. وإن كان هذا هو الرقم الوحيد الذي تبلّغ عنه، فبياناتك تبدو أكثر موثوقية مما هي عليه.

قِس الاتفاق حيث يكون صعبًا فعلًا. احسب اتفاق المُعلّقين بشكل منفصل لصحة الخطوة ولفئة الخطأ، لأنهما يسلكان سلوكًا مختلفًا: يتفق الناس على ما إذا كانت خطوة خاطئة أكثر بكثير من اتفاقهم على لماذا. وقارِن تحديدات أول خطوة خاطئة بين المُعلّقين، إذ إن تلك الخطوة الواحدة هي الأهمّ في تدريب نموذج مكافأة إجرائي، بالمعنى الوارد في PRM800K / "Let's Verify Step by Step" (Lightman وآخرون، 2023). وتعامل مع التقييم الآلي بارتياب: وجد AgentRewardBench أن الفحوص القائمة على القواعد التي تعتمد عليها المعايير الشائعة تميل إلى التقليل من نجاح الوكلاء، فالتصنيف الآلي الرخيص ليس بديلًا عن البشري، بل مجرد جولة أولى.

البتّ في الاختلاف وتأهيل المُعلّقين

الاختلاف على المسارات يعني عادةً أن التصنيف الهرمي غير محدد بدقة في موضع ما، لا أن مُعلّقًا زلّ. فحين ينقسم مُعلّقان على أي خطوة تُلام، يخبرك هذا الزوج من التصنيفات أن قاعدة التتالي غير محددة بدقة، والعلاج يعود إلى الإرشادات.

ممارستان تحملان معظم الثقل. أولًا، ابتّ في الاختلافات بدل التصويت عليها، لأن الحوار حول "لماذا اخترت تلك الخطوة" هو موضع كتابة القاعدة الحقيقية في المسارات؛ انظر البتّ وحسم الاختلاف. ثانيًا، أهّل المُعلّقين على الآثار الطويلة تدريجيًّا. المسارات مُتعِبة، والمُعلّق المرهق عند الخطوة 40 ليس الأداة نفسها التي كان عليها وهو نشيط عند الخطوة 2. حُدّ من طول التشغيلات الطويلة أو قسّمها إلى صفحات، وعايِر الجميع على مجموعة آثار مشتركة قبل أن يعملوا باستقلال.

كيف تفعل ذلك في Potato

يعرض نوع trajectory_eval في Potato كل خطوة على شكل بطاقة ويلحق بها تصنيفًا هرميًّا للأخطاء لكل خطوة مع أوزان خطورة، فتعيش التصنيفات المذكورة أعلاه داخل الإعداد.

yaml
annotation_schemes:
  - annotation_type: trajectory_eval
    name: step_evaluation
    description: "Evaluate each step for correctness and mark any errors."
    steps_key: steps
    error_types:
      - {name: reasoning,  subtypes: [logical_error, factual_error, planning_error]}
      - {name: execution,  subtypes: [wrong_tool, wrong_args, api_error]}
      - {name: safety,     subtypes: [harmful_action, data_leak, scope_violation]}
    severities:
      - {name: minor,    weight: -1}
      - {name: major,    weight: -5}
      - {name: critical, weight: -10}
    show_score: true

تتجمع أوزان الخطورة في درجة للمسار، فيمكنك ترتيب التشغيلات وتتبّع الانحدارات عبر إصدارات النماذج. وحين يكون الهدف تحديدًا أول خطوة خاطئة لتدريب نموذج مكافأة، ففي نوع process_reward وضع أول-خطأ مبني لهذا الغرض. ويستورد Potato الآثار من 15 صيغة إلى عرض خطوات موحّد، فتستطيع تعليق تشغيلة أيًّا كان الإطار الذي أنتجها؛ انظر التعليق الوكيلي.

قراءات إضافية

صفحات المعرض المبنية على معايير وكلاء حقيقية تعرض المخططات في سياقها: WebArena وτ-bench وAgentRewardBench.