مقارنة أدوات تقييم نماذج العالم وحلقات الروبوتات
المقاييس المرجعية وأدوات العرض وأدوات التوصيف المستخدمة لتقييم الفيديو المولَّد ونماذج العالم وحلقات الروبوتات: VBench وWorldModelBench وPhysics-IQ وATLAS وRerun وPotato.
تُقيَّم نماذج العالم ومولّدات الفيديو بمقاييس مرجعية مثل VBench وWorldModelBench وPhysics-IQ، تحدّد ما يُقاس وتوفّر مقيِّمين تلقائيين. ويُتحقَّق من هؤلاء المقيِّمين في ضوء الأحكام البشرية. أما جمع أحكام بشرية يمكن الدفاع عنها، مع مقيِّمين لا يعرفون النموذج الذي أنتج كل فيديو ومع الإبلاغ عن اتفاقهم، فهو عمل توصيف. وفي Potato مخططات للحكم على المسارات المولَّدة (rollouts) ولتقسيم حلقات الروبوتات.
يتنبأ نموذج العالم بكيفية تغيّر مشهد ما، غالبًا بمعلومية فعلٍ ما، ويمكن تقييم نموذج توليد الفيديو بوصفه نموذج عالم بالسؤال عمّا إذا كانت مخرجاته تخضع لقوانين الفيزياء وتتبع التعليمات التي أُعطيت له. والمسار المولَّد (rollout) هو استمرار واحد مولَّد. وحلقة الروبوت تسجيل لمحاولة واحدة لإنجاز مهمة، وعادةً تضم عدة بثوث كاميرا إضافةً إلى مواضع المفاصل وحالة القابض وإشارات أخرى.
تتناول هذه الصفحة نماذج العالم والفيديو المولَّد والروبوتات. أما المقارنة التي تجمع كل أنواع البيانات في صفحة واحدة ففي مقارنة أدوات التعليق بالذكاء الاصطناعي.
ما تفعله كل أداة
| الأداة | ما هي | أين يتدخل البشر |
|---|---|---|
| VBench | مجموعة مقاييس مرجعية لتوليد الفيديو، Apache-2.0 | توصيفات تفضيل بشرية لكل بُعد، للتحقق من أن الدرجات التلقائية توافق البشر |
| WorldModelBench | مقياس مرجعي لمولّدات الفيديو بوصفها نماذج عالم | 67,000 تسمية بشرية جُمعت بالحشد، واستُخدمت أيضًا لتدريب حَكَم تلقائي |
| Physics-IQ | مقياس مرجعي للفهم الفيزيائي في الفيديو التوليدي، من Google DeepMind | درجة ولوحة ترتيب |
| ATLAS | أداة سطح مكتب لتقسيم الأفعال طويلة المدى، مع دعم ROS bag وRLDS | موصِّف واحد لكل حلقة |
| Rerun، Foxglove | عرض بيانات الروبوتات | للمشاهدة، لا لدراسات الوسم |
| ELAN، BORIS | ترميز السلوك في الفيديو | يُبلغ ELAN عن موثوقية الاتفاق بين الموصِّفين |
| CVAT، Label Studio | توصيف الفيديو العام | مسارات وتسميات على خط زمني، دون مخطط لنماذج العالم |
| Potato | أداة توصيف فيها المخططان rollout_evaluation وepisode_annotation | عدة موصِّفين لكل عنصر، ولوحات عمياء، واتفاق يُبلَغ عنه |
المقاييس المرجعية تحدّد البروتوكول
يقيّم VBench نماذج تحويل النص إلى فيديو على 16 بُعدًا، منها اتساق الموضوع وسلاسة الحركة والعلاقات المكانية. ويضيف VBench-2.0 ثمانية عشر بُعدًا في الحس السليم والفيزياء والحركة البشرية والتكوين. ولكل بُعد جمع المؤلفون توصيفات تفضيل بشرية وبيّنوا أن الدرجات التلقائية تتبعها.
ويقيّم WorldModelBench مولّدات الفيديو في اتباع التعليمات والالتزام بالفيزياء، ويكشف مخالفات مثل جسم يتغيّر حجمه خلافًا لحفظ الكتلة. جمع المؤلفون بالحشد 67,000 تسمية بشرية لتقييم 14 نموذجًا رائدًا، ثم ضبطوا حَكَمًا بملياري معامل يتنبأ بمخالفات نمذجة العالم بدقة أعلى بنسبة 8.6% من GPT-4o (arXiv 2502.20694).
ويغطي Physics-IQ ميكانيكا الأجسام الصلبة وديناميكا الموائع والبصريات والديناميكا الحرارية والمغناطيسية. وعند اختبار Sora وRunway وPika وLumiere وStable Video Diffusion وVideoPoet، وجد مؤلفوه أن الفهم الفيزيائي محدود جدًا ولا علاقة له بالواقعية البصرية (arXiv 2501.09038).
استخدمها للمقاييس وللبروتوكولات المرجعية. فهي ما ستُقارَن به أي نتيجة.
أين يأتي الحكم البشري
يستخدم VBench الأحكام البشرية للتحقق من صحة أبعاده، ويستخدمها WorldModelBench لتدريب حَكَمه. وحين تقيّم نموذجك أنت، يجب تكرار الجزء البشري مع كل نقطة تحقق جديدة. وعندها تظهر فيه مشكلات أي دراسة توصيف: مقيِّمون يعرفون أي نموذج أنتج أي فيديو، ومقيِّمون يختلفون على ما يُعدّ مخالفة، ولا رقم اتفاق يُظهر أن التسميات جديرة بالثقة.
الحكم على المسارات المولَّدة في Potato
يعرض مخطط rollout_evaluation مسارين مولَّدين أو أكثر على ساعة مشتركة. يحدّد الموصِّف الإطار الذي يتوقف عنده العالم عن أن يكون منطقيًا، ويذكر أي خاصية فيزيائية أو سببية انكسرت، ويعبّر عن تفضيل وفق معايير، ويقيّم ما إذا كان الانحراف المغاير للواقع معقولًا بالنظر إلى التدخل. ويمكن إخفاء هوية النموذج في اللوحات وخلطها بترتيب ثابت لكل موصِّف، فلا تكشف إعادة تحميل الصفحة أي نموذج هو أيّ.
ويُبلَغ عن الاتفاق على نقطة الانكسار بثلاث طرق: هل رصد الموصِّفون انكسارًا أصلًا، وأين وضعوه، وأي فئة أعطوه. ويُعرض سماح المطابقة مسحًا عبر قيم متعددة بدل عتبة واحدة.
annotation_schemes:
- annotation_type: rollout_evaluation
name: rollout_review
description: "Where does each rollout stop making sense?"
streams:
- {field: real, name: "Recording", role: real}
- {field: gen_a, name: "Model A"}
- {field: gen_b, name: "Model B"}
fps: 25
layers: [violations, preference, counterfactual]
blind: true
shuffle: true
require_clean: trueيجعل require_clean من "لا انكسار" إجابةً صريحة، فيمكن التمييز بين مسار لم يشر إليه أحد ومسار لم يُكمل أحد مشاهدته. راجع كيف تقيّم الفيديو المولَّد ونماذج العالم.
توصيف حلقات الروبوتات
يضع مخطط episode_annotation عدة بثوث فيديو متزامنة ومسارات سلاسل زمنية للروبوت (مواضع المفاصل، وحالة القابض، والقوة والعزم، والمكافأة) على خط زمني واحد. يقسّم الموصِّفون المراحل، ويحدّدون نتيجة كل مرحلة، ويرسمون مكافأة تقدّم كثيفة، ويعيدون صياغة التعليمات بأثر رجعي. ويستورد Potato صيغ LeRobot v2 وHDF5 (RoboMimic وALOHA) وRLDS/TFDS، ويكتب ملف JSONL مرافقًا لكل إطار، فلا تحتاج مجموعة بيانات عامة للقراءة فقط إلى إعادة كتابة.
ويُبلَغ عن الاتفاق بوصفه IoU زمنيًا لحدود المراحل، وα لتسميات النتائج، وICC مع ارتباط بيرسون لمنحنيات المكافأة، مع ذكر نسبة التغطية، لأن ارتباطًا محسوبًا على 5% من خط زمني لا يقول شيئًا عن البقية.
ATLAS، من الجامعة التقنية في فيينا، أداة سطح مكتب لتقسيم الأفعال طويلة المدى تقرأ ROS bag وRLDS مباشرة. وقد صُمّمت خصيصًا لموصِّف واحد يضع الحدود بدقة. ونتيجتها المنشورة، أن عرض السلاسل الزمنية الحسّية العميقة إلى جانب الفيديو يقلّل خطأ الحدود مقارنةً بالفيديو وحده، هي سبب رسم Potato لتلك المسارات. وRerun وFoxglove أفضل أدوات عرض بيانات الروبوتات، ويظل ELAN وBORIS المعيار في ترميز السلوك. راجع كيف تُوصِّف حلقات الروبوتات.
ولتقييم الإسناد والإشارة في نماذج الرؤية واللغة، راجع تقييم إسناد نماذج VLM.
ما لا يفعله Potato هنا
- لا مقيِّم تلقائي للفيزياء. استخدم لذلك مقيِّم أحد المقاييس المرجعية، واستخدم Potato للتسميات البشرية التي يُتحقَّق منه في ضوئها.
- لا تدريب للنماذج ولا استدلال. يعرض Potato المسارات التي ولّدتها أنت.
- لا تسلسلات لسحب النقاط. يجري التوصيف ثلاثي الأبعاد إطارًا بإطار.
جرى التحقق من المستودع والورقة البحثية لكل مشروع في أغسطس وسبتمبر 2026.
الأسئلة الشائعة
كيف تُقيَّم نماذج العالم؟
بمقاييس مرجعية تقيّم الفيديو المولَّد في الالتزام بالفيزياء واتباع التعليمات والجودة البصرية، مثل VBench وWorldModelBench وPhysics-IQ، وبأحكام بشرية تتحقق من هؤلاء المقيِّمين أو تدرّبهم. وبالنسبة إلى نموذج جديد، يعني الجزء البشري أن يشاهد أشخاص المسارات المولَّدة، ويحدّدوا أين تفقد منطقها الفيزيائي، ويقارنوا بينها، دون أن يعرفوا أي نموذج أنتجها.
أي مقاييس نماذج العالم تستخدم الأحكام البشرية؟
جمع VBench توصيفات تفضيل بشرية لكل بُعد من أبعاده ليُظهر أن درجاته التلقائية توافق البشر. وجمع WorldModelBench بالحشد 67,000 تسمية بشرية عبر 14 نموذجًا واستخدمها لضبط حَكَم تلقائي.
ما الأداة التي يمكنني استخدامها لتوصيف حلقات الروبوتات؟
ATLAS أداة سطح مكتب لموصِّف واحد يقسّم حلقات طويلة من ROS bag أو RLDS. أما Potato فيوصّف الحلقات في المتصفح لعدة موصِّفين، ويستورد LeRobot v2 وHDF5 وRLDS/TFDS، ويُبلغ عن الاتفاق على حدود المراحل والنتائج ومنحنيات المكافأة.
كيف أقيس الاتفاق بين أشخاص يحكمون على فيديوهات مولَّدة؟
اجعل كل مسار مولَّد يُحكم عليه من مقيِّمَين على الأقل لا يعرفان أي نموذج أنتجه. وأبلغ عمّا إذا كانا يتفقان على أنه ينكسر أصلًا، ومدى قرب نقطتي الانكسار عبر عدة قيم للسماح، وما إذا كانا يعطيان الفئة نفسها. ويُبلغ rollout_evaluation في Potato عن هذه الثلاثة كلٌّ على حدة.