Skip to content
Guides6 min read

الاختلاف إشارة لا ضوضاء: متى تُبقي على اختلاف المُعلّقين بدل حسمه

خطوط التعليق مبنية لمحو الاختلاف، لكن الاختلاف في المهام الذاتية هو البيانات نفسها. دليل للتمييز بين التباين الحقيقي في التصنيف والخطأ، وللإبقاء عليه في Potato.

Potato Team

خط التعليق المعتاد آلة لإنتاج الاتفاق. تكتب الإرشادات، وتدرّب المُعلّقين، وتقيس اتفاق المُعلّقين، وتبتّ في الحالات التي يتباعد فيها الناس، وتشحن تصنيفًا ذهبيًّا واحدًا لكل عنصر. كل خطوة مصمّمة لعصر الاختلاف خارجًا، على افتراض أن الاختلاف خطأ وأن الخطأ ينبغي تقليله. هذا الافتراض سليم في كثير من المهام. وفي كثير غيرها يرمي بتباين حقيقي في طريقة قراءة الناس للعنصر.

حين يختلف المُعلّقون، يكون الاختلاف أحيانًا خطأً يُحسم وأحيانًا تباينًا حقيقيًّا يُحفَظ. في المهام الموضوعية التي لها إجابة صحيحة فعلية، اجمع إلى تصنيف ذهبي. أما في المهام الذاتية أو ذات المنظورات، فالتصنيف الذهبي الواحد يمحو توزيعًا حقيقيًّا للحكم البشري، والأفضل لك أن تحتفظ بتصنيف كل مُعلّق، وأن تخزّن توزيعًا بدل فائز، وأن تقيس الاتفاق دون افتراض أن ما دون الكمال معطوب.

افتراض التصنيف الذهبي الواحد

ما زال معظم تعلّم الآلة يفترض وجود تفسير صحيح واحد لكل عنصر، ولهذا يميل التعليق افتراضيًّا إلى التجميع: خذ ثلاثة تصنيفات، وخذ الأغلبية، وسمّها حقيقة. أطلق Plank (2022) على هذا اسم "مشكلة" التباين البشري في التصنيف، بعلامتَي تنصيص، لأن التأطير نفسه هو المشكلة. التباين الحقيقي في طريقة تصنيف الناس ليس دائمًا ضوضاء حول قيمة صحيحة خفية. فأحيانًا لا توجد قيمة صحيحة واحدة، وتوزّع الإجابات هو الوصف الأمين للعنصر.

وأدبيات المسح تدعم هذا عبر طيف واسع من المهام. راجع Uma وزملاؤه (2021) التعلّم من الاختلاف عبر معالجة اللغة الطبيعية ورؤية الحاسوب فوجدوا الاختلاف البشري في كل مكان، من وسم أقسام الكلام إلى الاستدلال اللغوي الطبيعي، إلى جانب مجموعة متنامية من الطرائق التي تتعلّم من الاختلاف بدل تسويته. ويدفع المنعطف المنظوري (Cabitza وCampagner وBasile، 2021) بالفكرة أبعد: التجميع بتصويت الأغلبية قد يكون مضلّلًا فعليًّا، والممارسة الأفضل تحتفظ بمنظورات من قاموا بالتصنيف.

من أين يأتي الاختلاف

ليس كل اختلاف يعني الشيء نفسه، فمن المفيد أن تسأل من أين جاء اختلاف بعينه. ثلاثة مصادر تغطي معظمه.

  • الإرشادات. يقرأ مُعلّقان القاعدة نفسها قراءتين مختلفتين، أو لا تغطي القاعدة الحالة التي أمامهما. هذا الاختلاف عيب، وعلاجه توضيح الإرشاد لا الإبقاء على التوزّع. وجولة تجريبية موجودة لالتقاط هذا بالضبط.
  • المُعلّق. شخص استعجل، أو أساء القراءة، أو عامل رديء الأداء ينقر مسرعًا. هذا خطأ، وينبغي التقاطه وإزالته. وهو ليس التباين الحقيقي، والخلط بينهما هو ما يحوّل "احتفظ بالاختلاف" إلى "احتفظ بالضوضاء".
  • العنصر. النص غامض فعلًا، أو الحكم يتوقف فعلًا على هوية القارئ. هل هذه الدعابة مسيئة؟ هل هذه المراجعة إيجابية أم مختلطة؟ هنا الإجابات المختلفة ليست أخطاء. هذا هو الاختلاف الجدير بالحفظ.

فصل المصدر الثالث عن الأولين هو معظم العمل. مشكلات الإرشادات تُصلَح وأخطاء المُعلّقين تُصفّى. وما يتبقى هو التباين الحقيقي على مستوى العنصر، وهو ما ينبغي الإبقاء عليه.

أداة قرار لاختلاف المُعلّقين: تتبّعه إلى مصدره. غموض الإرشادات يُصلَح، وخطأ المُعلّق يُصفّى، والتباين الحقيقي على مستوى العنصر أو المنظور يُحفَظ بوصفه إشارة بدل حسمه إلى تصنيف واحد.تتبّع كل اختلاف إلى مصدره: أصلح الإرشاد، وصفِّ الخطأ، واحتفظ بالتباين الحقيقي

مهمة موضوعية أم مهمة ذاتية

أوضح قاعدة تقريبية هي: هل يستطيع شخص عارف ومتأنٍّ أن يكون على يقين من الإجابة؟ إن كان نعم، فالمهمة موضوعية، والتصنيف الذهبي ذو معنى، والاختلاف شيء يُحسم. سواء أكان التاريخ 3 أبريل أم 4 مارس فله إجابة. وهل تحتوي الجملة على كيان مسمّى فله إجابة، في معظم الأحيان.

أما إن كان شخص عارف ومتأنٍّ قد يصل إلى موضع مختلف لأسباب مشروعة، فالمهمة ذاتية، وفرض تصنيف ذهبي يخترع يقينًا لا تملكه البيانات. الإساءة والسُّمّية والفكاهة والتهذيب والموقف وجماليات الصورة: كلها تتوقف على هوية الحاكم، والتباين بين الحكّام كثيرًا ما يكون الخاصية التي تهتم بها فعلًا. وهو أيضًا الموضع الذي تظهر فيه خصائص المُعلّقين الديموغرافية داخل التصنيفات، وهذا كل السبب في جمعها والتبليغ عنها.

معظم المشاريع الواقعية ليست هذا وحده ولا ذاك وحده. قِس الاتفاق أولًا، ثم اقرأه. الاتفاق المرتفع يعني أن المهمة تتصرف تصرّفًا موضوعيًّا وأن بإمكانك التجميع. والاتفاق الذي يظل متوسطًا في مهمة ذاتية يصف توزيعًا حقيقيًّا، والحفاظ على ذلك التوزيع أفضل من محاولة رفع الرقم قسرًا.

تخزين التصنيفات غير المجمّعة

الحفاظ على الاختلاف هو في معظمه قرار بشأن ما تخزّنه. فبدل تصنيف واحد لكل عنصر، تحتفظ بالتصنيفات غير المجمّعة: حكم كل مُعلّق مرتبطًا بالمُعلّق نفسه. ومن هناك يمكنك بناء تصنيف ليّن، أي توزيع على الفئات بدل فائز واحد، والتدريب أو التقييم مقابل التوزيع.

طريقتان للتعامل مع تصنيفات عدة مُعلّقين لعنصر واحد: تجميعها في تصنيف ذهبي صلب واحد، وهو ما يهدر التوزّع، أو الإبقاء عليها غير مجمّعة على شكل توزيع يحفظ مقدار الاختلاف الحقيقي الذي أثاره العنصر.جمّع إلى تصنيف ذهبي واحد فتفقد التوزّع، أو احتفظ بالتوزيع غير المجمّع

وهذا يغيّر التقييم أيضًا. النموذج الذي يتنبأ بتوزيع يمكن تسجيله مقابل التوزيع البشري بدل تصنيف واحد، فيُكافأ على عدم يقينه في العناصر التي لا يكون الناس متيقنين منها. وفي المهام الذاتية يكون ذلك هدفًا أمين أكثر من الدقة مقابل تصويت أغلبية اختلف معه نصف المُعلّقين.

لا شيء من هذا يعني التخلّي عن اتفاق المُعلّقين. أنت ما زلت تقيس الاتفاق؛ لكنك تكفّ عن معاملة أي رقم دون 1.0 بوصفه عيبًا يجب إزالته. الاتفاق يخبرك بمدى موضوعية سلوك المهمة. وقرار التجميع من عدمه قرار منفصل تتخذه وذلك الرقم بيدك.

كيف تفعل ذلك في Potato

لا يفرض Potato التوافق. فحين يصنّف عدة مُعلّقين العنصر نفسه، تُخزَّن تصنيفاتهم لكل مُعلّق على حدة، فتكون البيانات غير المجمّعة، وهي المادة الخام لأي نهج قائم على التوزيع، هي ما تحصل عليه افتراضيًّا. وأنت تختار ما إذا كنت ستجمّع لاحقًا، بدل أن تفقد التوزّع لحظة الجمع.

وفي المهام التي يكون الاختلاف فيها متعلقًا بالدرجة فعلًا، يتيح النوع soft_label لمُعلّق واحد أن يعبّر عن توزيع مباشرةً، بتوزيع نقاط على الفئات بدل اختيار واحدة:

yaml
annotation_schemes:
  - annotation_type: soft_label
    name: emotion_mix
    description: Distribute 100 points to reflect how much each emotion applies.
    labels: ["Joy", "Sadness", "Anger", "Fear", "Surprise"]
    total: 100
    show_distribution_chart: true

ولفصل الغموض الحقيقي عن خطأ المُعلّق، يساعد MACE. فهو يقدّر معًا درجة كفاءة لكل مُعلّق وإنتروبيا لكل عنصر، فيظهر المُعلّق منخفض الكفاءة (مصدر الخطأ) والعنصر مرتفع الإنتروبيا (مصدر التباين الحقيقي) شيئين مختلفين بدل كومة اختلاف واحدة غير مميَّزة:

yaml
mace:
  enabled: true
  min_annotations_per_item: 3

المُعلّق الذي تقارب كفاءته 0.4 على الأرجح ينقر مسرعًا ويمكن تصفيته. والعنصر ذو الإنتروبيا العالية بين مُعلّقين موثوقين بخلاف ذلك متنازَع عليه فعلًا، وهذا هو الاختلاف الذي تحتفظ به. وحين تحتاج مهمة فعلًا إلى إجابة واحدة، فـالبتّ موجود للحالات الموضوعية، مع تصنيف MACE المتوقَّع بوصفه إشارة إضافية للمُحكِّم. وهكذا يصير حسم الاختلاف قرارًا لكل مهمة بدل أن يقوم به الخط تلقائيًّا نيابةً عنك.

إلى أين بعد ذلك

مجموعتان ذاتيتان تستحقان النظر: GoEmotions، لتصنيفات المشاعر الدقيقة والمتنازَع عليها كثيرًا، وSocial Chemistry، لأحكام الأعراف الاجتماعية التي يختلف فيها العقلاء.