Skip to content
Announcements5 min read

Potato 2.7: قياس كيف تُصنع التصنيفات

يضيف Potato 2.7 تصنيفات بأشرطة خطأ، وغرف توحيد معايير حية، ومسابر حدود مضادة للواقع، وتسجيلاً بتنبؤ الأقران، ومبرّرات صوتية محلية، وتقارير مجموعات بيانات بأمر واحد، وتعليقاً توضيحياً من المحمول، ولا يحتاج أي منها إلى LLM. إضافةً إلى تقييم الوكلاء المتعددين والوكلاء متعددي الوسائط.

Potato Team

أداة التعليق التوضيحي تجمع تصنيفات. تلك هي وظيفتها، وقد أدّاها Potato منذ 2022. لكن التصنيف مخرَج قرار، وطوال معظم العقد الماضي ظل القرار نفسه غير مرئي: تحصل على الإجابة، لا على الاستدلال ولا الثقة ولا الاختلاف الذي أنتجها.

يقوم Potato 2.7 على فكرة واحدة. ينبغي لأداة التعليق التوضيحي أن تقيس كيف تُتخذ الأحكام، لا أن تسجّل ما كانت عليه فحسب. وينطبق ذلك على نوعَي الحَكَم معاً: البشر الذين يعلّقون، ونماذج الذكاء الاصطناعي التي تُقيَّم.

Potato 2.7: قِس كيف تُصنع التصنيفات، سواء أكان الحَكَم إنساناً أم نموذجاًPotato 2.7

تصنيفات بأشرطة خطأ

يلائم محرك القياس النفسي نموذج نظرية استجابة المفردة مع وصول التعليقات التوضيحية، فيقدّر قدرة كل معلّق وصعوبة كل عنصر من نمط الاتفاق وحده. بلا تصنيفات ذهبية، وبلا LLM.

فبدل sarcastic (2 of 3 votes)، يقول تصديرك sarcastic, p = 0.94 [0.88 – 0.97]. والاحتمال يزن من صوّت لا عددهم فقط.

yaml
assignment_strategy: psychometric
psychometrics:
  enabled: true
  confidence_threshold: 0.95   # items above this stop consuming budget

وينتج عن النموذج أمران. العناصر التي صار احتمالها البعدي واثقاً تتوقف عن العرض، فيذهب التكرار إلى حيث يُحتاج فعلاً. وعندما يصير تمييز عنصر سالباً، أي إن أفضل معلّقيك هم من يخالفون الجمهور، فذلك عادةً إرشاد معطوب لا معلّق سيّئ. وتشير لوحة التحكم إليه بوصفه خطأ محتملاً في دليل الترميز.

اجتماع المعايرة، داخل الأداة

كل فريق تعليق توضيحي يعقد جلسات توحيد معايير، وهي تجري دائماً تقريباً عبر مشاركة الشاشة وتنتهي نتائجها في ملاحظات أحدهم. وتنقل الغرف الجماعية تلك الجلسة إلى داخل Potato وتقيسها.

يصوّت الجميع بشكل أعمى. ثم يكشف المضيف. وتتناقش المجموعة. ولأي أحد أن يغيّر تصويته، ويُسجَّل كل تغيير بعد الكشف مقابل ما كانت عليه الأغلبية في تلك اللحظة، وهو سجل مسايرة لكل عضو. ويعمل مقياس Krippendorff's α حي على الأصوات العمياء والأصوات الحالية معاً، فيخبرك الفارق بينهما بما استحقه النقاش فعلاً، وهو يجري.

وتعبّئ غرف Huddle نفسها من العناصر التي يختلف عليها فريقك حالياً. وتتيح غرف Shadow للمتدربين مشاهدة معلّق خبير وهو يعمل، بتظليلاته وكل شيء.

مراقبة جودة بلا تصنيفات ذهبية

ميزتان تهاجمان المشكلة نفسها من اتجاهين مختلفين، ولا تزرع أي منهما عنصراً مزيّفاً.

يطرح Truth Serum سؤالاً إضافياً واحداً بعد كل تصنيف: ما النسبة المئوية للمعلّقين الآخرين الذين سيختارون ما اخترته؟ وتغذّي تلك التنبؤات مقدّر الشائع على نحو مفاجئ (Prelec, Seung & McCoy 2017، Nature)، الذي يتفوّق على تصويت الأغلبية في الموضع نفسه الذي يصعب فيه التعليق التوضيحي: حين يخطئ جمهور واثق وتصيب أقلية مطّلعة. وعلى حدّ علمنا، Potato هو أول أداة تعليق توضيحي تتضمن تسجيلاً بتنبؤ الأقران.

ويعرض مختبر الحدود تعديلاً مضاداً للواقع بأدنى قدر فور تثبيت تصنيف، ويسأل هل يصمد التصنيف أمامه. والإجابة بنقرة واحدة، فيبدأ التعليق التوضيحي الاعتيادي بإنتاج مجموعات تباين (Gardner et al. 2020) كأثر جانبي. وبعض المسابر إعادات صياغة تحافظ على المعنى، والمعلّق الذي ينقلب عليها يخبرك بشيء، دون زرع أي عنصر ذهبي واحد.

استدلال بشري، ملتقَط حرفياً

يتيح وضع Think-Aloud للمعلّقين أن يتحدثوا أثناء عملهم. ويعمل تحويل الكلام إلى نص محلياً عبر faster-whisper، فلا يغادر شيء الجهاز ولا توجد كلفة لكل رمز. ويُخزَّن النص التفريغي حرفياً وبلا تلخيص عن قصد، لأن إعادة صياغة بروتوكول التفكير بصوت مسموع تتلف الأثر الذي كنت تحاول جمعه.

والغاية ليست المبرّرات وحدها. هذا تسجيل لكيفية استدلال إنسان وصولاً إلى تصنيف، وهو النظير البشري لأدوات مكافأة العملية التي تقسّم كيفية استدلال نموذج. العنصر نفسه، وسلسلتا تفكير.

ميزتان أخريان، ثم الوكلاء

يحوّل وضع الورقة البحثية المشروع إلى تقرير مجموعة بيانات بصيغة LaTeX قابل للترجمة بأمر واحد: توزيعات التصنيفات، وجدول معلّقين، وإحصاءات اتفاق مع الاستشهادات الصحيحة، والتوقيت، وفقرة قيود صادقة بأرقام حقيقية فيها.

bash
python -m potato.paper config.yaml -o paper_export

ويجعل وضع الجيب التعليق التوضيحي من المحمول من الدرجة الأولى: تحصل أجهزة اللمس على رزمة بطاقات قابلة للسحب بأزرار في متناول الإبهام ومزامنة دون اتصال. أما المهام التي تحتاج فعلاً إلى سطح مكتب (المقاطع ومربعات الإحاطة والفيديو) فلا تُنقَص أبداً لتناسب الهاتف. بل تحصل على تحذير بدل ذلك.

تقييم وكلاء الذكاء الاصطناعي

يوجّه النصف الآخر من 2.7 الفلسفة نفسها نحو النماذج. فقد صارت مجموعة تقييم الوكلاء تعلّق على تشغيلة متعددة الوكلاء بوصفها فريقاً لا نصاً مسطحاً: رسم تفاعل قابل للنقر، وإسناد أعطال عبر الوكلاء، ومراجعة عمليات التسليم، وبطاقات أداء لكل وكيل وللفريق، وخط زمني لتنازع الأدوات، ووسم السلوكيات الناشئة عبر الوكلاء.

وتحصل الوكلاء متعددو الوسائط على أسطحهم الخاصة: مسارات واجهات المستخدم الرسومية واستخدام الحاسوب مع تحديد مواضع النقر، وخطوط زمنية صوتية كاملة الاتجاهين مع كشف المقاطعة، وتحديد الموضع الزمني في الفيديو مع IoU حي، وبنية جداول المستندات.

وإن أردت شرحاً تطبيقياً بدل القائمة، فقد كتبنا واحداً عن تتبّع أعطال الوكلاء المتعددين.

حيث يلتقي النصفان

هما الفكرة نفسها موجَّهة إلى حَكَمين مختلفين، وقد وصلهما 2.7 معاً.

يسجّل Think-Aloud كيفية استدلال إنسان وصولاً إلى تصنيف. ويلتقط تعليق مكافأة العملية كيفية استدلال نموذج، خطوة بخطوة. ضعهما جنباً إلى جنب على العنصر نفسه وسترى أين يتباعد الحكم البشري عن حكم الآلة.

وحَكَم LLM لا يستحق الثقة إلا بقدر ما تستحقه التصنيفات البشرية التي تحققتَ منه بها. وتخبرك لوحة مواءمة الحَكَم مع البشر بمدى اتفاق حَكَمك مع الناس؛ ويعطي القياس النفسي وTruth Serum تصنيفات أولئك الناس فترات ثقة. فتكفّ عبارة "الحَكَم يتفق مع البشر" عن كونها انطباعاً وتصير ادعاءً مصحوباً بفترة.

كل ما عدا ذلك

التعليق على الأحداث عبر المستندات، والتعليق على مستوى الأدوار في المحادثات والآثار، ودليل ترميز حيّ بمحرّر بصفحة كاملة، وربط عبر صفحات PDF مع OCR اختياري، وأدوار RBAC بمخططات لكل مجموعة، ولوحات تحكم للمشرفين والمعلّقين بعشر لغات.

وصار التثبيت أخفّ أيضاً. إذ تُحمَّل حزم SDK للذكاء الاصطناعي بكسل الآن، فلا يجلب pip install potato-annotation المجرّد أي SDK للذكاء الاصطناعي إطلاقاً، وينخفض زمن الإقلاع من نحو 2.0 ثانية إلى 0.7.

كيف تحصل عليه

bash
pip install --upgrade potato-annotation

Potato مجاني ومفتوح المصدر بترخيص GPL-3.0-or-later وقابل للاستضافة الذاتية. والميزات السبع أعلاه اختيارية ومحايدة تجاه نوع المهمة، ولا يحتاج أي منها إلى LLM. وذلك مهم إن كانت بياناتك لا تستطيع مغادرة مؤسستك، أو كانت ميزانيتك لا تحتمل فاتورة لكل رمز.

نُشر Potato 2.0 في ACL 2026 (العروض التوضيحية للأنظمة). وإن كان Potato مفيداً في بحثك، فتلك هي الورقة التي ينبغي الاستشهاد بها.

ابدأ من البدء السريع، أو تصفّح ما الجديد، أو اقرأ التعمّقين حول التصنيفات بأشرطة خطأ ومراقبة الجودة بلا تصنيفات ذهبية.