Skip to content
Guides6 min read

التصنيفات بأشرطة خطأ: نظرية استجابة المفردة للتعليق التوضيحي

تصويت الأغلبية يهدر معظم ما أخبرك به معلّقوك. تعطي نظرية استجابة المفردة كل تصنيف احتمالاً بعدياً وفترة ثقة، وتقدّر قدرة المعلّق وصعوبة العنصر، وتكشف مواضع العطب في دليل الترميز، بلا تصنيفات ذهبية وبلا LLM.

Potato Team

يعامل تصويت الأغلبية كل معلّق على أنه موثوق بالقدر نفسه وكل عنصر على أنه صعب بالقدر نفسه، ثم يبلّغ عن عدد بدل احتمال. وتتخلى نظرية استجابة المفردة (IRT) عن الافتراضين معاً: فهي تقدّر قدرة كل معلّق وصعوبة كل عنصر من نمط الاتفاق وحده، ثم تبلّغ عن كل تصنيف بوصفه احتمالاً بعدياً مع فترة ثقة. ولا تحتاج تصنيفات ذهبية ولا LLM. وهي في Potato محرك القياس النفسي، ويعمل لحظياً مع وصول التعليقات التوضيحية.

ثلاثة معلّقين يصنّفون عنصراً. اثنان يقولان sarcastic وواحد يقول sincere. فيسمّيه تصويت الأغلبية sarcastic ويمضي، وتسجّل مجموعة بياناتك ذلك بالثقة نفسها تماماً التي تسجّل بها عنصراً اتفق عليه الثلاثة.

وهذا إهدار للمعلومة. فالمخالف قد يكون أوثق معلّقيك. والعنصر قد يكون مما يجده الجميع صعباً. ولا تنجو أي من الحقيقتين من العدّ.

قدرة المعلّق مقدَّرة لحظياً مع فترات ثقة، فيحصل كل تصنيف على احتمال بعدي بدل تصويت مجرّدقدرة المعلّق مع فترات الثقة

ما نظرية استجابة المفردة؟

تأتي نظرية استجابة المفردة من القياس النفسي، حيث بُنيت لتصحيح الاختبارات المعيارية. والفكرة أن الاختبار يخبرك بأمرين في آن واحد: ما مقدار قدرة كل ممتحَن، وما مقدار صعوبة كل سؤال. ويمكنك تقدير الاثنين معاً من نمط الاستجابة وحده، لأن كلاً منهما يقيّد الآخر. فالسؤال الذي يخطئ فيه الطلاب المقتدرون سؤال صعب. والطالب الذي يصيب في الأسئلة الصعبة طالب مقتدر.

وللتعليق التوضيحي الشكل نفسه. فالمعلّقون ممتحَنون، والعناصر أسئلة، ولا أحد يملك مفتاح الإجابات.

ويلائم Potato تعميماً متعدد الفئات لخوارزمية GLAD (Whitehill et al. 2009)، وهو يقدّر ثلاثة أشياء معاً:

  • التصنيف الحقيقي لكل عنصر، بوصفه توزيعاً احتمالياً
  • قدرة كل معلّق (θ)، مع خطأ معياري
  • صعوبة كل عنصر، ومؤشر تمييز لكل عنصر

والملاءمة حتمية وتستغرق أجزاء من الألف من الثانية على مقياس دراسات التعليق التوضيحي، فيمكن تشغيلها باستمرار بدل تشغيلها دفعةً لاحقة.

تشغيلها

yaml
psychometrics:
  enabled: true
  schema: sarcasm
  confidence_threshold: 0.95
  min_annotators_per_item: 2

هذا وحده يعطيك طبقة التحليلات. ويتغير تصديرك من هذا:

text
sarcastic    (2 of 3 votes)

إلى هذا:

text
sarcastic    p = 0.94 [0.88 – 0.97]

والاحتمال هو الاحتمال البعدي للنموذج، وهو يزن من صوّت لا عددهم فقط. والفترة شريط حساسية فوق تقديرات القدرة.

وفي المراحل اللاحقة، ذلك الرقم يستحق أن يكون بحوزتك. فيمكنك التدريب على تصنيفات مرنة، أو ترشيح مجموعة تقييم بحيث تقتصر على العناصر فوق حدّ ثقة، أو معاملة العناصر منخفضة الاحتمال باعتبارها ملتبسة فعلاً لا مصنَّفة خطأً بصمت. فيكفّ الاختلاف عن كونه ضوضاء تُمحى بالمتوسط، وهي نقطة تستحق القراءة إلى جانب الاختلاف إشارة لا ضوضاء.

قدرة المعلّق، معروضة بصدق

تُقدَّر القدرة من أنماط الاتفاق. والقيمة 1.0 هي المسبق لمعلّق جديد، و0 تعني أن تصنيفات المعلّق لا تحمل أي معلومة، والقيم السالبة تعني الخطأ المنهجي.

ويأتي كل تقدير مصحوباً بخطئه المعياري، وهذا أهم من التقدير النقطي نفسه. فالمعلّق الذي أنجز اثني عشر تصنيفاً له شارب عريض، ولوحة التحكم ترسمه عريضاً. لا تتخذ قرارات تتعلق بالأشخاص بناءً على شارب عريض. فالأخطاء المعيارية تقريبية (معلومات Fisher عند المنوال) ومتفائلة قليلاً بحكم بنائها. وهي موجودة لتمنعك من المبالغة في قراءة رقم، لا لتجيز لك فصل أحد.

وإن أردت قراءة أبسط للكفاءة على أي مخطط فئوي، فـMACE هي ابنة العمّ الأكبر ولا تزال أداة جيدة. والفرق أن MACE تعمل بوصفها تحليلات دفعية، بينما يجلس القياس النفسي داخل حلقة الإسناد ويتصرّف في الدراسة أثناء جريانها.

كاشف أخطاء دليل الترميز

هذا هو الجزء الذي يفاجئ الناس.

إلى جانب الصعوبة، يقدّر النموذج التمييز: هل ترتبط قدرة المعلّق، في عنصر بعينه، بموافقة الإجماع؟ عادةً نعم. فالمعلّقون المقتدرون يوافقون الإجابة التي يستقر عليها الأمر أكثر، وهذا تقريباً معنى "مقتدر".

وحين يصير التمييز سالباً بقوة، فثمة خلل. إذ يخالف أفضل معلّقيك الجمهور منهجياً في ذلك العنصر. والتفسير الأرجح ليس أن أفضل معلّقيك صاروا فجأةً سيّئين، بل أن الإرشاد ملتبس أو خاطئ في تلك الحالة، وأن المعلّقين المدقّقين هم من ينتبهون.

ويعرض Potato هذه الحالات تحت "أخطاء محتملة في دليل الترميز". وهي عادةً أعلى العناصر قيمةً في الدراسة كلها، لأن كلاً منها عطب في الأداة لا عطب في شخص. أصلح الإرشاد ثم أعد التعليق. وغرفة توحيد المعايير مكان جيد لمعالجتها بوصفكم فريقاً.

إنفاق ميزانية التعليق التوضيحي حيث تشتري شيئاً

التكرار الثابت، أي قاعدة "ثلاثة معلّقين لكل عنصر، دائماً"، ينفق المقدار نفسه على عنصر يتفق عليه الجميع وعنصر يشقّ الفريق نصفين. وذلك مقلوب.

yaml
assignment_strategy: psychometric
num_annotators_per_item: 4
psychometrics:
  enabled: true
  confidence_threshold: 0.95
  cost_per_judgment: 0.08

مع هذا، حين يطلب معلّق عملاً، يرتّب Potato العناصر المتبقية بحسب مكسب المعلومات المتوقع من تصنيف ذلك المعلّق تحديداً لـذلك العنصر تحديداً. والعناصر التي تجاوز احتمالها البعدي confidence_threshold تتوقف عن العرض إطلاقاً. وتحصي لوحة التحكم الأحكام التي لم تضطر إلى شرائها، وتسعّرها إن ضبطت cost_per_judgment.

ملاحظتان تستحقان المعرفة قبل تشغيله:

  • البداية الباردة. إلى أن تتوافر تصنيفات كافية، يرجع الإسناد إلى العشوائي. فالنموذج لا يستطيع فصل القدرة عن الصعوبة دون تداخل بين المعلّقين، وهو لن يتظاهر بخلاف ذلك. وتعرض لوحة التحكم مقياس إحماء بدلاً منه.
  • الدفعات. يكون الترتيب أحدث ما يكون حين تكون الطوابير قصيرة. وتسليم كل معلّق دفعة من 200 عنصر يخفّف التكيّف، لأن الترتيب حُسب قبل وجود معظم تلك التصنيفات.

البتّ في التكرار قبل أن تنفق شيئاً

السؤال الذي يخمّنه كل مشروع هو كم معلّقاً لكل عنصر يحتاج. ويجيب عنه مصمّم الدراسة بمحاكاة مونت كارلو بدل التخمين:

bash
python -m potato.psychometrics.design --items 500 --accuracy 0.75 \
    --classes 3 --target-ci 0.10 --cost 0.08
text
ann/item   alpha     95% interval   width  majority acc  judgments       cost
       2   0.392 [ 0.330,  0.439]   0.109         0.751       1000      80.00
       3   0.388 [ 0.338,  0.431]   0.093         0.864       1500     120.00  <- recommended

والتوصية هي أرخص تكرار تكون فترة الثقة 95% لقيمة Krippendorff's α عنده أضيق من هدفك. أما مُدخَل --accuracy فهو الذي ينبغي أن تقيسه بدراسة تجريبية صغيرة بدل تخمينه.

والحساب نفسه يجري في متصفحك، إن كنت تفضّل ألا تثبّت شيئاً للإجابة عن السؤال.

ما لا يفعله هذا

نظرية استجابة المفردة ليست سحراً. وإليك بعض الحدود الصادقة:

  • تنمذج المخططات الفئوية أحادية الاختيار، radio وlikert. أما الاختيار المتعدد فغير منمذج.
  • تحتاج إلى تداخل بين المعلّقين. فإن صنّف كل عنصرٍ شخصٌ مختلف، فلا بنية اتفاق يُتعلَّم منها، وسيخبرك النموذج بأنه ما زال في طور الإحماء.
  • مع معلّق واحد، أو مع تصنيفات إجماعية في كل مكان، تكون الملاءمة منحلّة بحكم التصميم. وذلك سلوك صحيح لا عطب.

وما تحصل عليه في المقابل هو مجموعة بيانات يحمل فيها كل تصنيف لايقينه الخاص، ومجموعة معلّقين تفهمها، وقائمة بالمواضع التي انعطب فيها دليل الترميز.

قراءات إضافية