Skip to content

مقارنة أدوات تقييم وكلاء الذكاء الاصطناعي: LangSmith وLangfuse وPhoenix وPotato

مقارنة بين LangSmith وLangfuse وArize Phoenix وBraintrust وOpik وW&B Weave وPotato في المراجعة البشرية لمسارات الوكلاء: طوابير التوصيف وتسميات كل خطوة والاتفاق والاستضافة الذاتية.

أدوات تقييم وكلاء الذكاء الاصطناعي نوعان. منصات قابلية المراقبة، ومنها LangSmith وLangfuse وArize Phoenix وBraintrust وOpik، تتتبّع الوكيل في بيئة الإنتاج وتتيح للمراجعين إرفاق درجات بالتشغيلات والمقاطع. أما أدوات التوصيف مثل Potato فتبدأ من الدراسة البشرية: عدة مراجعين لكل مسار، وتسميات على كل خطوة، ومقياس لمدى اتفاق المراجعين. والنوعان يعملان معًا. واصل التتبّع حيث تتتبّع الآن، وصدّر التشغيلات التي تريد الحكم عليها، وأجرِ الدراسة في أداة التوصيف.

مسار الوكيل (trace) أو مساره التفصيلي يسجّل كل خطوة قام بها الوكيل: استدلاله، والأدوات التي استدعاها، وما أعادته. ويمكن للتقييم البشري أن يعطي درجة للتشغيل كله، أو يسم كل خطوة، أو يقارن تشغيلين جنبًا إلى جنب. ويعطي نموذج LLM بوصفه حَكَمًا الدرجات للمسارات تلقائيًا، ويحتاج إلى تسميات بشرية يُتحقَّق منه في ضوئها. راجع كيف تقيّم وكلاء الذكاء الاصطناعي.

تتناول هذه الصفحة تقييم الوكلاء ونماذج LLM. أما المقارنة التي تجمع كل أنواع البيانات في صفحة واحدة ففي مقارنة أدوات التعليق بالذكاء الاصطناعي.

أي أدوات تقييم الوكلاء تستحق المقارنة؟

الأداةصُمّمت لـالمراجعة البشرية
LangSmithتتبّع تطبيقات LangChain وLangGraph وتقييمهاطوابير توصيف مع تغذية راجعة وفق معايير، وعدة مراجعين لكل تشغيل، وطوابير مقارنة زوجية
Langfuseتتبّع مفتوح المصدر وإدارة للموجّهات وتقييمطوابير توصيف وإعدادات درجات فئوية أو عددية
Arize Phoenixالتتبّع والتقييمإعدادات توصيف لتغذية راجعة فئوية ومتصلة وحرّة من البشر أو نماذج LLM أو الشيفرة
Braintrustالتقييم والتسجيلدرجات المراجعة البشرية: فئوية ومتصلة ونص حر
Comet Opikتتبّع وتقييم مفتوحا المصدرطوابير توصيف تُشارك مع خبراء المجال عبر رابط
W&B Weaveالتتبّع والتقييمأدوات تقييم للتوصيف البشري تُعرَّف في الواجهة أو عبر الواجهة البرمجية
Label Studioالتوصيف العاميستورد مسارات من LangGraph وCrewAI وAutoGen لمراجعتها خطوة بخطوة
Potatoدراسات التوصيف البشريتسميات لكل خطوة مع تصنيف للأخطاء، ورسوم بيانية متعددة الوكلاء، ومقارنة زوجية، واتفاق بين المراجعين

الاستضافة الذاتية والسعر للأدوات الموجودة في مصفوفة القدرات لدينا:

الاستضافة الذاتيةالسعر
LangSmithفي خطة Enterprise فقط39 دولارًا للمقعد شهريًا
Langfuseمجانية (MIT)مجاني مع الاستضافة الذاتية
Comet Opikمجانية (Apache-2.0)مجاني مع الاستضافة الذاتية
Galileoعقد Enterprise100 دولار شهريًا
Potatoمجانية (GPL-3.0)مجاني

ماذا تفعل كل منصة بالدرجات البشرية

تدعم طوابير التوصيف في LangSmith مفاتيح تغذية راجعة وفق معايير، وعددًا قابلًا للضبط من المراجعين لكل تشغيل، وطوابير مقارنة زوجية، ومراجعين لا يرى أحدهم تغذية الآخر الراجعة.

يعرّف Langfuse الدرجات عبر إعدادات الدرجات، ويوجّه المسارات والملاحظات والجلسات إلى المراجعين عبر طوابير التوصيف. وفي منتدى مجتمعه، أفاد مستخدمون في نوفمبر 2025 بأن شخصين لا يزالان غير قادرين على توصيف المسار نفسه كلٌّ على حدة في طابور واحد، والحل البديل الذي نوقش هناك هو إعداد درجات منفصل لكل موصِّف (النقاش #4348). ويستطيع Langfuse حساب κ كوهين بين درجة بشرية ودرجة حَكَم LLM، لسلسلتين في كل مرة.

يمنح Arize Phoenix توصيفات البشر ونماذج LLM والشيفرة بنية واحدة، مع إعدادات توصيف تبقي التسميات متسقة بين المراجعات. ويمكن تصدير المقاطع الموصَّفة إلى مجموعة بيانات للتجارب أو لبناء مقيِّم متوافق مع الحكم البشري.

يرفق Braintrust درجات المراجعة البشرية بالسجلات والتجارب. وتشير وثائقه إلى أن إخفاء درجةٍ عن بعض المراجعين وسيلة لتخفيف ازدحام شاشة المراجعة وليس ضبطًا للوصول، إذ يستطيع أي مراجع إظهار كل الدرجات.

يضع Comet Opik المسارات والمحادثات في طوابير توصيف يمكن مشاركتها مع خبراء المجال عبر رابط، في شاشة مراجعة مصمَّمة لمراجعين غير تقنيين.

ويسجّل W&B Weave التغذية الراجعة البشرية عبر أدوات تقييم للتوصيف البشري تُنشأ في الواجهة أو عبر الواجهة البرمجية.

لم نجد في وثائق التوصيف لدى LangSmith وLangfuse وPhoenix وBraintrust وOpik أي إحصاء للاتفاق بين المراجعين البشريين، عند تحققنا في أغسطس وسبتمبر 2026. كلٌّ منها يجمع الأحكام البشرية بوصفها درجات. أما Labelbox وScale AI فتبيعان بيانات تقييم الوكلاء خدماتٍ مُدارة، وهذا شراء من نوع آخر: فهما توفّران المراجعين أيضًا.

أين يختلف Potato

  • مسارات من أطر عمل كثيرة. تقرأ المحوِّلات 15 صيغة: ReAct وOpenAI وAnthropic وLangChain (التي تغطي صادرات LangSmith) وLangfuse، وسجلات متعددة الوكلاء من CrewAI وAutoGen وLangGraph، وSWE-bench وSWE-Agent وClaude Code وAider وWebArena، وMind2Web وغيرها من تسجيلات المتصفح، وMCP وOpenTelemetry وATIF.
  • تسميات على كل خطوة. يسجّل مخطط trajectory_eval ما إذا كانت كل خطوة صحيحة، ونوع الخطأ من تصنيف هرمي، ودرجة الخطورة، ودرجة تراكمية. وهذه التسميات نفسها هي بيانات التدريب لـنماذج مكافأة العمليات.
  • بنية متعددة الوكلاء. يحرّر المراجعون رسمًا بيانيًا للتفاعلات، ويحدّدون المسار الحرج، وينسبون الإخفاق إلى وكيل وخطوة، ويراجعون عمليات التسليم. أما عرض Agent Graphs في Langfuse فيعرض تشغيلًا متعدد الوكلاء رسمًا بيانيًا لأغراض تصحيح الأخطاء، لكن المراجعين لا يستطيعون توصيفه. راجع كيف تقيّم الأنظمة متعددة الوكلاء.
  • الاتفاق بين المراجعين. يمكن أن يذهب كل مسار إلى عدة مراجعين لا يرى أحدهم تسميات الآخر، ويُبلَغ عن الاتفاق بين الموصِّفين. وتقارن معايرة الحَكَم حَكَم LLM بتسميات بشرية عمياء. راجع كيف تقيس الاتفاق بين حَكَم LLM والموصِّفين البشريين.
  • وكلاء البرمجة واستخدام الحاسوب. فروق موحّدة (unified diffs) مع تلوين للصياغة، ومخرجات الطرفية، وتعليقات مراجعة مثبّتة على الأسطر. وتعرض تشغيلات استخدام الحاسوب لقطات شاشة مع مواضع النقرات. راجع تقييم وكلاء البرمجة وتقييم وكلاء استخدام الحاسوب.

نقل المسارات إلى Potato

صدّر من أداة قابلية المراقبة التشغيلات التي تريد مراجعتها، ثم حوّلها:

bash
python -m potato.trace_converter \
  --input langfuse_traces.json \
  --output data/traces.jsonl \
  --input-format langfuse

تستخدم صادرات التشغيلات من LangSmith الخيار --input-format langchain. وإن لم يكن إطار عمل ما في القائمة، يختار --auto-detect محوِّلًا بناءً على أسماء الحقول.

مهمة مراجعة خطوة بخطوة في Potato

yaml
annotation_schemes:
  - annotation_type: trajectory_eval
    name: step_evaluation
    description: "Evaluate each step for correctness and mark any errors."
    steps_key: steps
    error_types:
      - {name: reasoning, subtypes: [logical_error, factual_error, planning_error]}
      - {name: execution, subtypes: [wrong_tool, wrong_args, api_error]}
    severities:
      - {name: minor, weight: -1}
      - {name: major, weight: -5}
    show_score: true

راجع توصيف مسارات الوكلاء لتصميم تصنيف الأخطاء.

ما لا يفعله Potato مع الوكلاء

  • ليس خدمة لمراقبة الإنتاج. فيه حزمة تطوير للتتبّع مع التصدير إلى OpenTelemetry، لكن لا سحابة مستضافة ولا لوحات مصمَّمة لزمن الاستجابة والتكلفة عبر حركة الإنتاج. وهو يُستضاف ذاتيًا فقط.
  • لا يوفّر مراجعين. أحضر مراجعيك، أو جنّدهم عبر Prolific.

الأسئلة الشائعة

ما الفرق بين LangSmith وLangfuse في المراجعة البشرية؟

كلاهما يرفق درجات بشرية بالمسارات والمقاطع عبر طوابير التوصيف. LangSmith مملوك، ويمكن استضافته ذاتيًا في خطة Enterprise، ويدعم عدة مراجعين لكل تشغيل وطوابير مقارنة زوجية. أما Langfuse فمرخّص بـ MIT ويُستضاف ذاتيًا مجانًا، ويفيد مستخدمون في منتداه بأن شخصين لا يستطيعان بعدُ إعطاء درجة للمسار نفسه كلٌّ على حدة في طابور واحد. ولا يوثّق أيٌّ منهما إحصاءً للاتفاق بين المراجعين البشريين.

هل هناك بديل مفتوح المصدر لـ LangSmith لتقييم الوكلاء؟

للتتبّع ومنح الدرجات، Langfuse (MIT) وComet Opik (Apache-2.0) مفتوحا المصدر ويُستضافان ذاتيًا مجانًا. ولدراسات التقييم البشري، مع عدة مراجعين لكل مسار وتسميات لكل خطوة واتفاق، Potato مفتوح المصدر ومجاني. ويقرأ Potato صادرات LangSmith وLangfuse، فيمكنه العمل إلى جانب أيٍّ منهما.

كيف أقيس الاتفاق بين المراجعين البشريين لمسارات الوكلاء؟

أسند كل مسار إلى مراجعَين على الأقل لا يرى أحدهما تسميات الآخر، ثم احسب κ كوهين لمراجعَين أو ألفا كريبندورف لأكثر من ذلك، سؤالًا بسؤال. وتتطلب تسميات الخطوات مطابقة الخطوات أولًا. ويتناول شرح الاتفاق بين الموصِّفين اختيار المعامل.

هل يمكنني استخدام Potato مع مسارات من LangSmith أو Langfuse؟

نعم. يحوّل python -m potato.trace_converter صادرات التشغيلات من LangSmith بالخيار --input-format langchain وصادرات Langfuse بالخيار --input-format langfuse. أبقِ تتبّع الإنتاج حيث هو، وانقل إلى Potato المسارات التي تريد الحكم عليها.

قراءات إضافية