مقارنة أدوات تقييم وكلاء الذكاء الاصطناعي: LangSmith وLangfuse وPhoenix وPotato
مقارنة بين LangSmith وLangfuse وArize Phoenix وBraintrust وOpik وW&B Weave وPotato في المراجعة البشرية لمسارات الوكلاء: طوابير التوصيف وتسميات كل خطوة والاتفاق والاستضافة الذاتية.
أدوات تقييم وكلاء الذكاء الاصطناعي نوعان. منصات قابلية المراقبة، ومنها LangSmith وLangfuse وArize Phoenix وBraintrust وOpik، تتتبّع الوكيل في بيئة الإنتاج وتتيح للمراجعين إرفاق درجات بالتشغيلات والمقاطع. أما أدوات التوصيف مثل Potato فتبدأ من الدراسة البشرية: عدة مراجعين لكل مسار، وتسميات على كل خطوة، ومقياس لمدى اتفاق المراجعين. والنوعان يعملان معًا. واصل التتبّع حيث تتتبّع الآن، وصدّر التشغيلات التي تريد الحكم عليها، وأجرِ الدراسة في أداة التوصيف.
مسار الوكيل (trace) أو مساره التفصيلي يسجّل كل خطوة قام بها الوكيل: استدلاله، والأدوات التي استدعاها، وما أعادته. ويمكن للتقييم البشري أن يعطي درجة للتشغيل كله، أو يسم كل خطوة، أو يقارن تشغيلين جنبًا إلى جنب. ويعطي نموذج LLM بوصفه حَكَمًا الدرجات للمسارات تلقائيًا، ويحتاج إلى تسميات بشرية يُتحقَّق منه في ضوئها. راجع كيف تقيّم وكلاء الذكاء الاصطناعي.
تتناول هذه الصفحة تقييم الوكلاء ونماذج LLM. أما المقارنة التي تجمع كل أنواع البيانات في صفحة واحدة ففي مقارنة أدوات التعليق بالذكاء الاصطناعي.
أي أدوات تقييم الوكلاء تستحق المقارنة؟
| الأداة | صُمّمت لـ | المراجعة البشرية |
|---|---|---|
| LangSmith | تتبّع تطبيقات LangChain وLangGraph وتقييمها | طوابير توصيف مع تغذية راجعة وفق معايير، وعدة مراجعين لكل تشغيل، وطوابير مقارنة زوجية |
| Langfuse | تتبّع مفتوح المصدر وإدارة للموجّهات وتقييم | طوابير توصيف وإعدادات درجات فئوية أو عددية |
| Arize Phoenix | التتبّع والتقييم | إعدادات توصيف لتغذية راجعة فئوية ومتصلة وحرّة من البشر أو نماذج LLM أو الشيفرة |
| Braintrust | التقييم والتسجيل | درجات المراجعة البشرية: فئوية ومتصلة ونص حر |
| Comet Opik | تتبّع وتقييم مفتوحا المصدر | طوابير توصيف تُشارك مع خبراء المجال عبر رابط |
| W&B Weave | التتبّع والتقييم | أدوات تقييم للتوصيف البشري تُعرَّف في الواجهة أو عبر الواجهة البرمجية |
| Label Studio | التوصيف العام | يستورد مسارات من LangGraph وCrewAI وAutoGen لمراجعتها خطوة بخطوة |
| Potato | دراسات التوصيف البشري | تسميات لكل خطوة مع تصنيف للأخطاء، ورسوم بيانية متعددة الوكلاء، ومقارنة زوجية، واتفاق بين المراجعين |
الاستضافة الذاتية والسعر للأدوات الموجودة في مصفوفة القدرات لدينا:
| الاستضافة الذاتية | السعر | |
|---|---|---|
| LangSmith | في خطة Enterprise فقط | 39 دولارًا للمقعد شهريًا |
| Langfuse | مجانية (MIT) | مجاني مع الاستضافة الذاتية |
| Comet Opik | مجانية (Apache-2.0) | مجاني مع الاستضافة الذاتية |
| Galileo | عقد Enterprise | 100 دولار شهريًا |
| Potato | مجانية (GPL-3.0) | مجاني |
ماذا تفعل كل منصة بالدرجات البشرية
تدعم طوابير التوصيف في LangSmith مفاتيح تغذية راجعة وفق معايير، وعددًا قابلًا للضبط من المراجعين لكل تشغيل، وطوابير مقارنة زوجية، ومراجعين لا يرى أحدهم تغذية الآخر الراجعة.
يعرّف Langfuse الدرجات عبر إعدادات الدرجات، ويوجّه المسارات والملاحظات والجلسات إلى المراجعين عبر طوابير التوصيف. وفي منتدى مجتمعه، أفاد مستخدمون في نوفمبر 2025 بأن شخصين لا يزالان غير قادرين على توصيف المسار نفسه كلٌّ على حدة في طابور واحد، والحل البديل الذي نوقش هناك هو إعداد درجات منفصل لكل موصِّف (النقاش #4348). ويستطيع Langfuse حساب κ كوهين بين درجة بشرية ودرجة حَكَم LLM، لسلسلتين في كل مرة.
يمنح Arize Phoenix توصيفات البشر ونماذج LLM والشيفرة بنية واحدة، مع إعدادات توصيف تبقي التسميات متسقة بين المراجعات. ويمكن تصدير المقاطع الموصَّفة إلى مجموعة بيانات للتجارب أو لبناء مقيِّم متوافق مع الحكم البشري.
يرفق Braintrust درجات المراجعة البشرية بالسجلات والتجارب. وتشير وثائقه إلى أن إخفاء درجةٍ عن بعض المراجعين وسيلة لتخفيف ازدحام شاشة المراجعة وليس ضبطًا للوصول، إذ يستطيع أي مراجع إظهار كل الدرجات.
يضع Comet Opik المسارات والمحادثات في طوابير توصيف يمكن مشاركتها مع خبراء المجال عبر رابط، في شاشة مراجعة مصمَّمة لمراجعين غير تقنيين.
ويسجّل W&B Weave التغذية الراجعة البشرية عبر أدوات تقييم للتوصيف البشري تُنشأ في الواجهة أو عبر الواجهة البرمجية.
لم نجد في وثائق التوصيف لدى LangSmith وLangfuse وPhoenix وBraintrust وOpik أي إحصاء للاتفاق بين المراجعين البشريين، عند تحققنا في أغسطس وسبتمبر 2026. كلٌّ منها يجمع الأحكام البشرية بوصفها درجات. أما Labelbox وScale AI فتبيعان بيانات تقييم الوكلاء خدماتٍ مُدارة، وهذا شراء من نوع آخر: فهما توفّران المراجعين أيضًا.
أين يختلف Potato
- مسارات من أطر عمل كثيرة. تقرأ المحوِّلات 15 صيغة: ReAct وOpenAI وAnthropic وLangChain (التي تغطي صادرات LangSmith) وLangfuse، وسجلات متعددة الوكلاء من CrewAI وAutoGen وLangGraph، وSWE-bench وSWE-Agent وClaude Code وAider وWebArena، وMind2Web وغيرها من تسجيلات المتصفح، وMCP وOpenTelemetry وATIF.
- تسميات على كل خطوة. يسجّل مخطط
trajectory_evalما إذا كانت كل خطوة صحيحة، ونوع الخطأ من تصنيف هرمي، ودرجة الخطورة، ودرجة تراكمية. وهذه التسميات نفسها هي بيانات التدريب لـنماذج مكافأة العمليات. - بنية متعددة الوكلاء. يحرّر المراجعون رسمًا بيانيًا للتفاعلات، ويحدّدون المسار الحرج، وينسبون الإخفاق إلى وكيل وخطوة، ويراجعون عمليات التسليم. أما عرض Agent Graphs في Langfuse فيعرض تشغيلًا متعدد الوكلاء رسمًا بيانيًا لأغراض تصحيح الأخطاء، لكن المراجعين لا يستطيعون توصيفه. راجع كيف تقيّم الأنظمة متعددة الوكلاء.
- الاتفاق بين المراجعين. يمكن أن يذهب كل مسار إلى عدة مراجعين لا يرى أحدهم تسميات الآخر، ويُبلَغ عن الاتفاق بين الموصِّفين. وتقارن معايرة الحَكَم حَكَم LLM بتسميات بشرية عمياء. راجع كيف تقيس الاتفاق بين حَكَم LLM والموصِّفين البشريين.
- وكلاء البرمجة واستخدام الحاسوب. فروق موحّدة (unified diffs) مع تلوين للصياغة، ومخرجات الطرفية، وتعليقات مراجعة مثبّتة على الأسطر. وتعرض تشغيلات استخدام الحاسوب لقطات شاشة مع مواضع النقرات. راجع تقييم وكلاء البرمجة وتقييم وكلاء استخدام الحاسوب.
نقل المسارات إلى Potato
صدّر من أداة قابلية المراقبة التشغيلات التي تريد مراجعتها، ثم حوّلها:
python -m potato.trace_converter \
--input langfuse_traces.json \
--output data/traces.jsonl \
--input-format langfuseتستخدم صادرات التشغيلات من LangSmith الخيار --input-format langchain. وإن لم يكن إطار عمل ما في القائمة، يختار --auto-detect محوِّلًا بناءً على أسماء الحقول.
مهمة مراجعة خطوة بخطوة في Potato
annotation_schemes:
- annotation_type: trajectory_eval
name: step_evaluation
description: "Evaluate each step for correctness and mark any errors."
steps_key: steps
error_types:
- {name: reasoning, subtypes: [logical_error, factual_error, planning_error]}
- {name: execution, subtypes: [wrong_tool, wrong_args, api_error]}
severities:
- {name: minor, weight: -1}
- {name: major, weight: -5}
show_score: trueراجع توصيف مسارات الوكلاء لتصميم تصنيف الأخطاء.
ما لا يفعله Potato مع الوكلاء
- ليس خدمة لمراقبة الإنتاج. فيه حزمة تطوير للتتبّع مع التصدير إلى OpenTelemetry، لكن لا سحابة مستضافة ولا لوحات مصمَّمة لزمن الاستجابة والتكلفة عبر حركة الإنتاج. وهو يُستضاف ذاتيًا فقط.
- لا يوفّر مراجعين. أحضر مراجعيك، أو جنّدهم عبر Prolific.
الأسئلة الشائعة
ما الفرق بين LangSmith وLangfuse في المراجعة البشرية؟
كلاهما يرفق درجات بشرية بالمسارات والمقاطع عبر طوابير التوصيف. LangSmith مملوك، ويمكن استضافته ذاتيًا في خطة Enterprise، ويدعم عدة مراجعين لكل تشغيل وطوابير مقارنة زوجية. أما Langfuse فمرخّص بـ MIT ويُستضاف ذاتيًا مجانًا، ويفيد مستخدمون في منتداه بأن شخصين لا يستطيعان بعدُ إعطاء درجة للمسار نفسه كلٌّ على حدة في طابور واحد. ولا يوثّق أيٌّ منهما إحصاءً للاتفاق بين المراجعين البشريين.
هل هناك بديل مفتوح المصدر لـ LangSmith لتقييم الوكلاء؟
للتتبّع ومنح الدرجات، Langfuse (MIT) وComet Opik (Apache-2.0) مفتوحا المصدر ويُستضافان ذاتيًا مجانًا. ولدراسات التقييم البشري، مع عدة مراجعين لكل مسار وتسميات لكل خطوة واتفاق، Potato مفتوح المصدر ومجاني. ويقرأ Potato صادرات LangSmith وLangfuse، فيمكنه العمل إلى جانب أيٍّ منهما.
كيف أقيس الاتفاق بين المراجعين البشريين لمسارات الوكلاء؟
أسند كل مسار إلى مراجعَين على الأقل لا يرى أحدهما تسميات الآخر، ثم احسب κ كوهين لمراجعَين أو ألفا كريبندورف لأكثر من ذلك، سؤالًا بسؤال. وتتطلب تسميات الخطوات مطابقة الخطوات أولًا. ويتناول شرح الاتفاق بين الموصِّفين اختيار المعامل.
هل يمكنني استخدام Potato مع مسارات من LangSmith أو Langfuse؟
نعم. يحوّل python -m potato.trace_converter صادرات التشغيلات من LangSmith بالخيار --input-format langchain وصادرات Langfuse بالخيار --input-format langfuse. أبقِ تتبّع الإنتاج حيث هو، وانقل إلى Potato المسارات التي تريد الحكم عليها.