Skip to content

التعليق بواسطة الخبراء مقابل التعليق بواسطة الجمهور

متى يضاهي مُعلِّقو الجمهور الخبراء، وكم مُعلِّقًا تحتاج لكل عنصر، وكم يكلّف كل نهج، وكيف تنمذج كفاءة المُعلِّقين بدلًا من الاعتماد على تصويت الأغلبية.

استخدم مُعلِّقي الجمهور حين يصل شخص غير متخصص يتبع إرشاداتك بعناية إلى الحكم نفسه الذي يصل إليه المتخصص، واجمع عدة أحكام لكل عنصر بدلًا من حكم واحد. وجد Snow et al. (2008) أن أربعة تعليقات من غير الخبراء في المتوسط تضاهي اتفاق مُعلِّق خبير واحد عبر خمس مهام في اللغة الطبيعية.

يُطرح الاختيار بين مُعلِّقي الخبراء ومُعلِّقي الجمهور عادةً بوصفه مفاضلة بين الجودة والتكلفة، وهذا إطار خاطئ لمعظم المهام. السؤال هو ما إذا كان الحكم يتوقف على تدريب لا يملكه الجمهور. المشاعر والاستلزام النصي وتشابه الكلمات لا تتوقف عليه غالبًا. أما الترميز السريري والتصنيف القانوني والنسخ الصوتي فتتوقف عليه غالبًا.

ما تسنده الأدلة

تأتي النتيجة التأسيسية من Snow et al. (2008)، الذين قارنوا تعليقات غير الخبراء من Amazon Mechanical Turk بمعايير ذهبية وضعها خبراء، في التعرف على الانفعال، وتشابه الكلمات، والتعرف على الاستلزام النصي، والترتيب الزمني للأحداث، وفك التباس معاني الكلمات. وبتجميع المهام كلها يذكرون أنه "يلزم 4 تعليقات فقط من غير الخبراء لكل مثال لبلوغ ITA مكافئ لما يبلغه مُعلِّق خبير واحد" ("it requires only 4 non-expert annotations per example to achieve the equivalent ITA as a single expert annotator"). وللتكلفة يعطون معدلًا لا نسبة: جمعوا 7,000 تعليق انفعالي بدولارين، ووصفوا ذلك بأنه "ما لا يقل عن 875 تصنيفًا مكافئًا لتصنيف خبير لكل دولار أمريكي" ("at least 875 expert-equivalent labels per USD").

التباين بين المهام داخل ذلك المتوسط أهم من المتوسط نفسه. ففي مهمة الانفعال لديهم، بلغ الغضب والاشمئزاز والحزن مستوى الخبراء باثنين من غير الخبراء، واحتاجت المفاجأة إلى تسعة، أما الخوف فلم يبلغه قط ضمن المُعلِّقين العشرة الذين جمعوهم. المتوسط على مستوى المهمة يخفي التصنيفات التي لا يعوّض فيها الجمهور عن التدريب.

ووجد Callison-Burch (2009) النمط نفسه في تقييم الترجمة الآلية، إذ أعاد إنتاج أحكام WMT08 بعشرة دولارات، وذكر أن أحكام غير الخبراء مجتمعةً "ترتبط بأحكام الخبراء ارتباطًا أقوى مما يرتبط به Bleu" ("correlate more strongly with expert judgments than Bleu does").

والوجه المقابل أن الخبراء أسرع أحيانًا. أجرى Alfter et al. (2022) مهمة best-worst scaling على التعبيرات متعددة الكلمات مع متحدثين بلغة ثانية، ومهنيين في اللغة، وخبراء في الإطار الأوروبي المرجعي المشترك. ارتبطت ترتيبات المجموعات الثلاث ارتباطًا عاليًا، فكانت الجودة متقاربة، غير أن التعليق المباشر من الخبراء استغرق من 15 إلى 90 دقيقة لكل مشروع مقابل نحو ثماني إلى تسع ساعات للنسخة الجماهيرية، وهو ما يصفونه بأنه "أسرع بخمسة أضعاف على الأقل" ("at least five times as fast"). وحيث يتوفر عدد صغير من المتخصصين أصلًا، قد يكلّف تحويل العمل إلى الجمهور وقتًا أكثر مما يوفّره.

الآلية هي التكرار، لا الجمهور

حكم واحد من الجمهور أسوأ من حكم واحد من خبير في كل دراسة مما سبق. وما يسدّ الفجوة هو جمع عدة أحكام لكل عنصر ودمجها، فيصبح سؤال التصميم هو كيفية دمجها.

يعامل تصويت الأغلبية كل المُعلِّقين على أنهم متساوون في الموثوقية، وهم ليسوا كذلك. وثمة نموذجان يقدّران الموثوقية من البيانات بدلًا من ذلك. قدّم Dawid and Skene (1979) إجراء تعظيم التوقع الذي يقدّر مصفوفة التباس لكل مُلاحِظ إلى جانب التصنيفات الصحيحة الكامنة، وكان أصلًا لخطأ المُلاحِظ السريري. وMACE، أي Multi-Annotator Competence Estimation، نموذج استجابة للمفردة بُني لحالة التعهيد الجماعي، يتعلّم بلا إشراف أي المُعلِّقين جدير بالثقة ويتنبأ بالتصنيفات الكامنة وراء الأحكام. وقد بناه مؤلفوه لأن "بعض المُعلِّقين يختارون تصنيفات سيئة لتعظيم أجرهم" ("some annotators choose bad labels in order to maximize their pay")، وهو نمط إخفاق يبتلعه تصويت الأغلبية بصمت متى تشارَكه عدد كافٍ من المُعلِّقين.

يوفّر Potato الاثنين معًا. يشغّل بلوك mace تقدير الكفاءة على التعليقات المجموعة، وتشغّل حاسبة Dawid-Skene المُقدِّر على التصنيفات التي تلصقها.

yaml
mace:
  enabled: true
 
num_annotators_per_item: 4
 
gold_standards:
  enabled: true
 
attention_checks:
  enabled: true

القيمة num_annotators_per_item: 4 تتبع نتيجة Snow et al. لا قيمة افتراضية من عندنا، وهي القيمة التي ينبغي مراجعتها لكل مهمة بدلًا من نقلها من مشروع إلى آخر. تلتقط المعايير الذهبية وفحوص الانتباه المُعلِّق الذي لا يقرأ، وهو أمر تتعامل معه نماذج الكفاءة على نحو أفضل حين يتوفر لديها بعض العناصر المثبَّتة لتعايِر عليها.

الاختلاف ليس خطأً بالضرورة

معاملة كل اختلاف على أنه مشكلة جودة تقود إلى التدخل الخاطئ. حلّل Plank et al. (2014) اختلافات المُعلِّقين في تعليق أقسام الكلام ووجدوا أن "2% فقط من اختيارات المُعلِّقين غير مبرَّرة لغويًا" ("only 2% of annotator choices are linguistically unmotivated")، وخلصوا إلى أن أغلب الاختلافات تأتي من حالات قابلة للجدل لغويًا لا من أخطاء.

واختبر Pavlick and Kwiatkowski (2019) ما إذا كان الاختلاف في الاستدلال باللغة الطبيعية يزول بمزيد من البيانات، وهو لا يزول. يذكران أن الاختلافات "لا يمكن صرفها بوصفها 'ضجيج' تعليق، بل تبقى كلما جمعنا مزيدًا من التقييمات وكلما نوّعنا مقدار السياق المتاح للمُقيِّمين" ("are not dismissible as annotation 'noise', but rather persist as we collect more ratings and as we vary the amount of context provided to raters"). ويعمّم Plank (2022) هذه النقطة تحت اسم التباين البشري في التصنيف.

الاختبار العملي رخيص. اجمع مزيدًا من الأحكام على العناصر التي يختلف عليها المُعلِّقون. فإذا تقارب الاتفاق، كان الاختلاف ضجيجًا ويعالجه التكرار. وإذا بقي مستويًا، فالعنصر غامض فعلًا، والاستجابة الصحيحة هي تسجيل التوزيع بدل فرض تصنيف واحد.

التدريب يغيّر الاتفاق أكثر مما يغيّره نوع المُعلِّق

أجرى Bayerl and Paul (2011) تحليلًا بَعديًا لـ 96 دراسة تعليق في فك التباس معاني الكلمات، والنسخ العروضي، والنسخ الصوتي، شملت 346 مؤشر اتفاق. فسّرت سبعة عوامل التباين في الاتفاق، واثنان منها يخصان التدريب، أي هل تلقى المُعلِّقون تدريبًا أصلًا وكم كان مكثفًا. أما البقية فهي مجال التعليق، وعدد الفئات في المخطط، وعدد المُعلِّقين، والغرض من التعليق، والطريقة المستخدمة لحساب نسبة الاتفاق المئوية.

تعيد تلك النتيجة صياغة القرار بين الخبراء والجمهور. فالمُعلِّق الجماهيري المدرَّب الذي يعمل بمخطط مُختبَر قليل الفئات كثيرًا ما يحقق اتفاقًا أعلى من متخصص غير مدرَّب يعمل بمخطط غامض. وكتابة إرشادات التعليق واختيار مخطط التعليق يفعلان للاتفاق أكثر مما تفعله قناة التوظيف.

أين يفشل التعليق الجماهيري

ثلاثة شروط تجعل الجمهور الخيار الخاطئ. أن يتطلب الحكم معرفة مُعتمَدة، كما في الترميز السريري أو القانوني، حيث لا يكون التصنيف الخاطئ مجرد ضجيج. وألّا تستطيع البيانات مغادرة بنيتك التحتية، وهو ما يستبعد أي سوق عامة أيًّا كانت جودتها. وأن تكون مجموعة التصنيفات كبيرة أو هرمية بما يجعل تكلفة تدريب كل مُعلِّق تتجاوز الوفر، وهذا شائع فوق بضع عشرات من الفئات تقريبًا.

وحين يتحقق الشرط الأول مع حجم عمل كبير، فإن التصميم المختلط يتفوق عادةً على الطرفين. يصنّف الخبراء مجموعة جزئية، فتصير تلك المجموعة المعيار الذهبي، ويُفرَز مُعلِّقو الجمهور عليها قبل وصولهم إلى المهمة الحقيقية. وتتناول المعايير الذهبية وفحوص الانتباه آليات الفرز.

قراءات إضافية

المراجع

Snow, R., O'Connor, B., Jurafsky, D., and Ng, A. Y. (2008). Cheap and Fast – But is it Good? Evaluating Non-Expert Annotations for Natural Language Tasks. Proceedings of EMNLP 2008, 254-263. https://aclanthology.org/D08-1027/

Callison-Burch, C. (2009). Fast, Cheap, and Creative: Evaluating Translation Quality Using Amazon's Mechanical Turk. Proceedings of EMNLP 2009, 286-295. https://aclanthology.org/D09-1030/

Dawid, A. P., and Skene, A. M. (1979). Maximum Likelihood Estimation of Observer Error-Rates Using the EM Algorithm. Journal of the Royal Statistical Society. Series C (Applied Statistics), 28(1), 20-28. https://doi.org/10.2307/2346806

Hovy, D., Berg-Kirkpatrick, T., Vaswani, A., and Hovy, E. (2013). Learning Whom to Trust with MACE. Proceedings of NAACL-HLT 2013, 1120-1130. https://aclanthology.org/N13-1132/

Plank, B., Hovy, D., and Søgaard, A. (2014). Linguistically debatable or just plain wrong? Proceedings of ACL 2014 (Volume 2: Short Papers), 507-511. https://doi.org/10.3115/v1/P14-2083

Pavlick, E., and Kwiatkowski, T. (2019). Inherent Disagreements in Human Textual Inferences. Transactions of the Association for Computational Linguistics, 7, 677-694. https://aclanthology.org/Q19-1043/

Bayerl, P. S., and Paul, K. I. (2011). What Determines Inter-Coder Agreement in Manual Annotations? A Meta-Analytic Investigation. Computational Linguistics, 37(4), 699-725. https://doi.org/10.1162/COLI_a_00074

Alfter, D., Lindström Tiedemann, T., and Volodina, E. (2022). Crowdsourcing Relative Rankings of Multi-Word Expressions: Experts versus Non-Experts. Northern European Journal of Language Technology, 7(1). https://doi.org/10.3384/nejlt.2000-1533.2021.3128

Plank, B. (2022). The "Problem" of Human Label Variation: On Ground Truth in Data, Modeling and Evaluation. Proceedings of EMNLP 2022, 10671-10682. https://doi.org/10.18653/v1/2022.emnlp-main.731