Skip to content

مقارنة أدوات التعليق على الصور: CVAT وLabel Studio وRoboflow وV7 وPotato

مقارنة بين CVAT وLabel Studio وRoboflow وV7 وSupervisely وSegments.ai وX-AnyLabeling وVIA وPotato في الصناديق والتقسيم والنقاط المفتاحية والصور العملاقة وسحب النقاط ثلاثية الأبعاد.

لوسم الرؤية الحاسوبية بأحجام كبيرة، CVAT هو الأداة المفتوحة المصدر المرجعية، وتضيف Roboflow وV7 وSupervisely تدريب النماذج أو سير العمل المُدار بوصفها منتجات تجارية. يناسب Potato الحالات التي تكون فيها تسميات الصور بيانات بحثية: يوسم عدة موصِّفين الصور نفسها، وعلى الدراسة أن تُبلغ عن مدى اتفاقهم. ويناسب أيضًا حين تشترك الصور في دراسة واحدة مع نصوص أو صوت أو مخرجات نماذج.

الصندوق المحيط هو المستطيل حول جسم. وتقسيم الصور يُسند البكسلات إلى الأجسام، مضلعاتٍ أو أقنعة. وتحدّد النقاط المفتاحية معالم مثل المفاصل، ويصلها هيكل عظمي. ويقيس التقاطع على الاتحاد (IoU) مدى تداخل شكلين، وتستخدمه معظم الأدوات لمقارنة الموصِّفين.

تتناول هذه الصفحة الصور وشرائح الصور العملاقة وسحب النقاط ثلاثية الأبعاد. أما المقارنة التي تجمع كل أنواع البيانات في صفحة واحدة ففي مقارنة أدوات التعليق بالذكاء الاصطناعي.

أي أدوات التعليق على الصور تستحق المقارنة؟

الأداةتعمل بوصفهاالتكلفةمناسبة لـ
Potatoاستضافة ذاتية (GPL-3.0)مجانيةالدراسات متعددة الموصِّفين التي تُبلغ عن الاتفاق
CVATاستضافة ذاتية (MIT) أو مستضافةمجانية؛ المستضافة بـ 33 دولارًا لكل مستخدم شهريًاالصناديق والأقنعة وتتبّع الفيديو بأحجام كبيرة
Label Studioاستضافة ذاتية أو مستضافةالنسخة المجتمعية مجانية؛ الخطط المدفوعة من 99 دولارًا شهريًاالصور في مشاريع توسم أيضًا النصوص أو الصوت أو الفيديو
Roboflowمستضافةتجاريةالانتقال من التسميات إلى كاشف مدرَّب ومنشور
V7مستضافةتجاريةسير عمل مُدار، وصيغ التصوير الطبي، ووسم بمساعدة النماذج
Superviselyاستضافة ذاتية أو مستضافةنسخة مجتمعية؛ ومستويات تجاريةالصور الكبيرة والأبعاد الثلاثة وتدريب النماذج في منتج واحد
Segments.aiمستضافةتجاريةسحب النقاط ثلاثية الأبعاد ودمج المستشعرات
X-AnyLabelingتطبيق سطح مكتبمجانيةشخص واحد يوسم محليًا بنماذج كثيرة
VIAملف HTML واحد يعمل دون اتصال في المتصفحمجانية (BSD-2-Clause)مشاريع صغيرة دون تثبيت أي شيء

الصناديق والمضلعات والنقاط المفتاحية

كل أداة هنا ترسم صناديق ومضلعات. وتدعم CVAT وLabel Studio وRoboflow وV7 وSupervisely وSegments.ai وPotato أيضًا النقاط المفتاحية مع الهياكل العظمية. ويضيف Potato الخطوط المتعددة والقطوع الناقصة والمكعبات ثنائية الأبعاد وأقنعة الفرشاة المرتبطة بكل نسخة.

تُلحق منصات الرؤية الحاسوبية الناضجة سماتٍ بكل جسم، مثل مستوى الحجب أو علامة الاقتطاع أو نوع فرعي. ولا يفعل Potato ذلك بعد. فالهندسة فيه تحمل تسمية، والسمات الإضافية تحتاج مخططًا مرافقًا.

التقسيم بمساعدة نموذج

يحوّل التقسيم التفاعلي نقرةً أو مخططًا تقريبيًا إلى قناع محكم. ويشغّله Potato في المتصفح، دون الحاجة إلى توفير وحدة GPU. وتصل إليه CVAT عبر دوال Nuclio أو مسار وكلاء الذكاء الاصطناعي فيها، وLabel Studio عبر خلفية تعلّم آلي. أما Roboflow وV7 وSupervisely وSegments.ai فتدمجه في المنتج.

ويعيد التقسيم بالنص قناعًا للجسم الذي تسمّيه. يشغّله Potato في المتصفح بنموذج مرخّص بـ Apache-2.0. وتستخدم Roboflow وV7 النموذج SAM 3 على خوادمهما، وتقدّمه Supervisely عبر التطبيقات، وLabel Studio عبر خلفية تعلّم آلي. ويجمع X-AnyLabeling بين Grounding DINO وGrounded-SAM 2 وSAM 2.1 وYOLO في تطبيق سطح مكتب، ويصعب التفوق عليه لشخص واحد يوسم محليًا بنماذج كثيرة. وتبدأ ميزة Potato حين يكون هناك أكثر من موصِّف واحد.

راجع كيف تُوصِّف أقنعة تقسيم الصور ووسم الأجسام بكتابة أسمائها.

الصور العملاقة وشرائح علم الأمراض

يبني Potato هرمًا من البلاطات يُقدَّم بصيغتي DZI وIIIF Image API 3.0. وتعمل أقنعة الفرشاة بالدقة الكاملة للمصدر، لأن ذاكرة القناع المؤقتة تفهرس بكسلات الصورة لا نسيجًا في GPU، فلا يوجد سقف لحجم النسيج. وتحصل ملفات TIFF العلمية بعمق 16 بت على نافذة بالمئينات كي تبقى البنى الباهتة ظاهرة. وتتعامل V7 وSupervisely أيضًا مع الصور الكبيرة جدًا، وCVAT جزئيًا. راجع التعليق على الصور العملاقة بالتكبير العميق.

لعلم الأمراض الرقمي، بُني QuPath (تطبيق سطح مكتب مفتوح المصدر، وهو معيار المجال) وCytomine (تطبيق ويب مفتوح المصدر مع توصيف أعمى متعدد المستخدمين) لهذا الغرض تحديدًا. ولا يقرأ Potato صيغ SVS ولا DICOM ولا NIfTI.

سحب النقاط ثلاثية الأبعاد

يوصّف Potato سحب PCD وPLY وLAS وKITTI .bin و.xyz بمكعبات ثلاثية الأبعاد ونقاط وخطوط متعددة ومقاطع لكل نقطة. ويخزّن دوران المكعب رباعيًّا (quaternion)، فتصمد زاويتا الانحدار والتدحرج في التحويل ذهابًا وإيابًا، ويقارن المكعبات بـ IoU ثلاثي الأبعاد مدوَّر ودقيق. ويجري التوصيف إطارًا بإطار.

Segments.ai وKognic وDeepen AI وSupervisely وXtreme1/BasicAI أدوات متخصصة، وهي متقدمة في خطوط الإنتاج للقيادة الذاتية: سير عمل على التسلسلات مع نشر المسارات، ودعم للرادار ولعدة مستشعرات LiDAR، ومكعبات تُضبط تلقائيًا. وتتعامل CVAT وSupervisely وSegments.ai مع تسلسلات سحب النقاط، وهو ما لا يفعله Potato. راجع كيف تُوصِّف سحب النقاط ثلاثية الأبعاد.

قياس الاتفاق على تسميات الصور

تقارن معظم أدوات الرؤية الحاسوبية الموصِّفين بالتداخل. يقارن محرك الإجماع في CVAT ومرحلة الإجماع في V7 بين الموصِّفين بـ IoU خام مقابل عتبة لكل فئة، ويسرد Label Studio Enterprise التطابق التام والفرق العددي وIoU وتداخل المقاطع. ولا يصحّح أيٌّ من هذه المقاييس أثر الصدفة، وIoU صندوقين على جسم كبير مرتفع حتى لو رُسما بإهمال.

يُبلغ Potato عن الاتفاق على الهندسة مع خط أساس تجريبي للصدفة. ولم نجد منصة توصيف أخرى تُبلغ عن اتفاق مصحَّح للصدفة على التسميات المكانية. ويشرح كيف تقيس الاتفاق بين الموصِّفين على الصناديق المحيطة الطريقة.

ويجلب التوسيم المسبق مشكلة ثانية. فالموصِّفون الذين يقبلون اقتراحات النموذج دون فحصها يرفعون كل أرقام الاتفاق ويخفضون الدقة. ويسجّل Potato توقيتات الرسم، وهي ما يميّز الاقتراح الذي رُوجع عن الاقتراح المقبول دون نظر. راجع كشف التوسيمات المسبقة المقبولة دون مراجعة.

الصيغ

يستورد Potato 15 صيغة للرؤية الحاسوبية، منها 11 تعمل ذهابًا وإيابًا. ويصدّر بصيغ COCO وYOLO وPascal VOC وCVAT وLabelMe وCityscapes وKITTI وV7 Darwin وأقنعة PNG وMOT وDAVIS. راجع صيغ الرؤية الحاسوبية.

مهمة صناديق محيطة بموصِّفَين لكل صورة

yaml
agreement_metrics:
  enabled: true
 
annotation_schemes:
  - annotation_type: image_annotation
    name: objects
    description: "Draw a tight box around every vehicle."
    source_field: image
    tools: [bbox]
    labels:
      - {name: car, color: "#FF6B6B"}
      - {name: truck, color: "#4ECDC4"}
 
num_annotators_per_item:
  default: 2

تذهب كل صورة إلى موصِّفَين، وتُبلغ لوحة الإدارة عن اتفاقهما على الصناديق.

ما لا يفعله Potato مع الصور

  • لا تدريب للنماذج. يوسم Potato مسبقًا بنماذج موجودة، لكنه لا يدرّب الكواشف. وتفعل ذلك Roboflow وV7 وSupervisely وLabelbox.
  • لا سمات لكل جسم بعد.
  • لا تسلسلات لسحب النقاط. يجري التوصيف ثلاثي الأبعاد إطارًا بإطار.
  • لا DICOM ولا NIfTI ولا صيغ الشرائح الكاملة.
  • لا قوى عاملة مُدارة. أحضر موصِّفيك، أو جنّدهم عبر Prolific.

جرى التحقق من التوثيق وصفحة الأسعار لكل مشروع في أغسطس وسبتمبر 2026.

الأسئلة الشائعة

ما أفضل أداة مجانية للتعليق على الصور؟

للأعمال الكبيرة التي تقتصر على الرؤية الحاسوبية، CVAT مجانية وناضجة وتُستضاف ذاتيًا. وللصور في مشروع يوسم أيضًا نصوصًا أو صوتًا، تغطي النسخة المجتمعية من Label Studio وPotato المجال كله. وللدراسات التي يوسم فيها عدة موصِّفين الصور نفسها ويجب الإبلاغ فيها عن الاتفاق، يوفّر Potato ذلك مجانًا. ولحفنة من الصور دون تثبيت أي شيء، يعمل VIA من ملف HTML واحد.

هل هناك بديل مفتوح المصدر لـ Labelbox؟

CVAT والنسخة المجتمعية من Label Studio وPotato مفتوحة المصدر وتُستضاف ذاتيًا. تبيع Labelbox منصة مُدارة وقوة عاملة للوسم. أما الأدوات المفتوحة المصدر فتوفّر البرمجيات لا الموصِّفين، فتُحضر فريقك أو تجنّد عبر منصة مثل Prolific.

هل يمكنني تشغيل التقسيم بمساعدة النماذج دون خادم GPU؟

نعم. يشغّل Potato التقسيم التفاعلي والتقسيم بالنص في المتصفح عبر ONNX Runtime Web، ويعمل دون شبكة بمجرد وجود أوزان النموذج على الجهاز. أما نشر أقنعة الفيديو باستخدام SAM 2 فيعمل على الخادم. ويشغّل X-AnyLabeling النماذج محليًا على سطح المكتب. وتستدعي CVAT وLabel Studio خادم نماذج.

كيف أقيس الاتفاق بين الموصِّفين على الصناديق المحيطة؟

أسند كل صورة إلى موصِّفَين على الأقل، وطابق صناديقهما، وأبلغ عن اتفاق يراعي الصدفة، لأن IoU الخام مرتفع على الأجسام الكبيرة أيًّا كان ما يفعله الموصِّفون. ويتناول دليل الاتفاق على الصناديق المحيطة المطابقة وخط أساس الصدفة وما ينبغي الإبلاغ عنه.

أي أداة توصيف أستخدم لسحب النقاط ثلاثية الأبعاد؟

لبيانات القيادة في الإنتاج مع التسلسلات ونشر المسارات، استخدم أداة متخصصة مثل Segments.ai أو Kognic أو Supervisely، أو CVAT إن كان لا بد من المصدر المفتوح. وللمكعبات إطارًا بإطار حين تحتاج إحصاءات الاتفاق، أو حين تكون الأبعاد الثلاثة جزءًا من دراسة متعددة الوسائط، يناسب Potato.

قراءات إضافية