Skip to content
Guides6 min read

مراقبة الجودة بلا تصنيفات ذهبية

المعايير الذهبية مكلفة، وتتسرّب، ولا تختبر إلا الحالات التي خطر لك أن تزرعها. طريقتان بديلتان، التسجيل بتنبؤ الأقران والمسابر الحدّية المضادة للواقع، تكشفان المعلّقين غير المنتبهين والإرشادات المعطوبة دون زرع عنصر واحد.

Potato Team

الطريقة المعتادة لفحص جودة التعليق التوضيحي هي زرع عناصر تعرف إجابتها سلفاً ثم النظر في من يخطئ فيها. وهي تنفع، لكن بناءها مكلف، وهي لا تختبر إلا الحالات التي خطر لك أن تزرعها، والمعلّقون المخضرمون يتعلمون كيف يميّزون العناصر المزروعة. وثمة أسلوبان يعطيانك إشارة جودة بلا أي عنصر ذهبي إطلاقاً: التسجيل بتنبؤ الأقران، الذي يطلب من المعلّقين أن يتوقعوا ما سيقوله غيرهم، والسبر المضاد للواقع، الذي يسأل هل يصمد التصنيف أمام تعديل صغير. ويتضمن Potato كليهما، بوصفهما Truth Serum ومختبر الحدود.

المعايير الذهبية وفحوص الانتباه هي الجواب الافتراضي عن سؤال "كيف أعرف أن معلّقيّ منتبهون"، وهي تستحق مكانتها. لكن لها ثلاث كلف حقيقية.

عليك أن تبنيها، وهذا يعني وقت خبير يُنفَق في تصنيف عناصر تفهمها أصلاً. وهي لا تغطي إلا أنماط الفشل التي توقّعتها. وفي أي مهمة طويلة الأمد، ينتهي الأمر بالمعلّقين إلى التعرّف عليها. والعنصر الذهبي الذي يُعاد استخدامه عنصر ذهبي كفّ عن قياس أي شيء.

والأسلوبان أدناه يتجاوزان الثلاثة جميعاً، ولا يحتاج أي منهما إلى LLM.

تنبؤ الأقران: اسأل عمّا سيقوله الآخرون

بعد أن يختار المعلّق تصنيفاً، يطلب Truth Serum شيئاً واحداً إضافياً:

اخترتَ Sarcastic. ما النسبة المئوية للمعلّقين الآخرين الذين سيختارون التصنيف نفسه؟

شريط تمرير واحد. نقرة واحدة. وذلك الرقم الإضافي وحده يؤدي قدراً مدهشاً من العمل.

تسجيل بتنبؤ الأقران: "ما النسبة المئوية للمعلّقين الآخرين الذين سيختارون التصنيف نفسه؟"بطاقة التنبؤ في Truth Serum

لماذا يحمل التنبؤ معلومة

الطريقة هي مبدأ الشائع على نحو مفاجئ (Prelec, Seung & McCoy 2017، Nature؛ بناءً على مصل الحقيقة البايزي لـ Prelec، 2004). والادعاء أن أفضل تقدير للحقيقة ليس الإجابة الأكثر شيوعاً، بل الإجابة التي كانت أكثر شيوعاً مما توقّع الناس أن تكون.

والاستدلال يجري هكذا. من يحمل رأي أقلية صحيحاً يعرف عادةً أنه في أقلية. فهو يرى لماذا سيجيب معظم الناس إجابة مختلفة، ويقول ذلك حين تطلب منه أن يتنبأ. أما من يحمل مفهوماً خاطئاً شائعاً فيميل إلى افتراض أن الجميع يوافقونه. فحين تتجاوز إجابةٌ شعبيتَها المتوقعة، تكون تلك الفجوة دليلاً على أن من اختاروها يعرفون شيئاً لا يعرفه الجمهور.

ويفشل تصويت الأغلبية أشد ما يفشل في الموضع نفسه الذي يخطئ فيه جمهور واثق وتصيب أقلية مطّلعة. وتلك هي الحالة التي بُني لها التسجيل بمبدأ الشائع على نحو مفاجئ.

yaml
truth_serum:
  enabled: true
  schema: sarcasm
  min_annotators: 5

وعلى حدّ علمنا، Potato هو أول أداة تعليق توضيحي تتضمن تسجيلاً بتنبؤ الأقران.

ما الذي تخرج به منه

ثلاثة أشياء، لم يحتج أي منها إلى مفتاح إجابات.

طابور "حيث يُرجَّح أن الجمهور مخطئ". كل عنصر يختلف فيه تصنيفه الشائع على نحو مفاجئ عن تصنيف الأغلبية. هذه هي العناصر التي تستحق انتباه خبير، وهي عادةً أقل بكثير مما كنت تخشى.

درجات معايرة لكل معلّق. كم يبعد الاتفاق الذي توقّعه كل شخص عن الاتفاق الذي ناله فعلاً. فمن يتوقع باستمرار أن 90% من الآخرين سيوافقونه، وينال باستمرار 55%، يخبرك بشيء عن وعيه بذاته. وقد عرفتَ ذلك دون أن تزرع شيئاً.

المواءمة مع الحكم الشائع على نحو مفاجئ. كم مرة يطابق تصنيف كل معلّق ذلك الحكم، وهو مؤشر تقريبي على كونه مطّلعاً لا مجرّد مجارٍ للآخرين.

وملاحظة قبل أن تستشهد به: هذه هي الصيغة المبسّطة القائمة على التنبؤ بشعبية الإجابة الذاتية، حيث يتوقع كل معلّق شعبية التصنيف الذي اختاره هو لا توزيعاً كاملاً على كل التصنيفات. وmin_annotators: 3 حدّ أدنى لا توصية. وعند خمسة فأكثر تكفّ الأحكام عن كونها مشوّشة.

المسابر المضادة للواقع: اسأل هل يصمد التصنيف أمام تعديل

يجد Truth Serum العناصر التي أخطأ فيها الجمهور. أما مختبر الحدود فيجد شيئاً مختلفاً: المواضع التي يلتبس فيها دليل الترميز، والمعلّقون الذين لا يقرؤون فعلاً.

فبمجرد أن يُثبَّت تصنيف، يعرض Potato تعديلاً بأدنى قدر على النص ويسأل هل ما يزال التصنيف صحيحاً.

قلتَ Polite. هل يصمد ذلك أمام هذا التعديل؟

بعد كل تصنيف، مسبر مضاد للواقع فوق فرق ملوّن: "هل يبقى ذلك صحيحاً؟"مسبار من مختبر الحدود

الإجابة بنقرة واحدة. لكن لأنك سألت، صار التعليق التوضيحي الاعتيادي ينتج ثلاثة أشياء لا يوفّرها تصدير التصنيفات وحده.

مجموعات التباين، بوصفها أثراً جانبياً

كل مسبار مُجاب عنه هو زوج مُصنَّف (الأصل، المضاد للواقع). وذلك هو مجموعة التباين: بيانات معزّزة بالمضادات للواقع من النوع الذي تبيّن أنه يحسّن متانة النماذج (Gardner et al. 2020، Evaluating Models' Local Decision Boundaries via Contrast Sets؛ Kaushik et al. 2020).

وبناء مجموعات التباين عادةً جهد منفصل ومكلف. أما هنا فتسقط من التصنيف الذي كنت تقوم به على أي حال.

yaml
boundary_probing:
  enabled: true
  schema: politeness
  probes_per_item: 3
  include_invariance: true
  sources: [precomputed, llm, rules]

وقائمة sources سلسلة تراجع. فيمكنك أن تشحن مضادات واقع منسّقة مع بياناتك، أو تولّدها بـ LLM، أو تدع الطبقة القائمة على القواعد تنتجها من تحويلات معجمية مثل قلب النفي وتبديل أدوات التشديد وعلامات التأدّب. وتلك الطبقة الأخيرة هي سبب عمل مختبر الحدود دون أي LLM مضبوط إطلاقاً، وهي سبب تراجع الميزة بلطف بدل تعطّلها حين لا يضبط أحد مفتاح API.

مراقبة جودة غير مرئية

بعض المسابر مسابر ثبات: إعادات صياغة تحافظ على المعنى. فتصير "Send me the slides before the meeting" ("أرسل لي الشرائح قبل الاجتماع") هي "Before the meeting, send me the slides" ("قبل الاجتماع، أرسل لي الشرائح").

والمعلّق المتّسق لا ينقلب عليها أبداً. ومن ينقلب فإما أنه لا يقرأ بعناية وإما أنه لا يملك فكرة مستقرة عن معنى التصنيف. وفي الحالتين تريد أن تعرف، وقد عرفتَ دون زرع عنصر مزيّف واحد. والمسبار لا يُميَّز عن العمل الاعتيادي، لأنه هو العمل الاعتيادي.

وتعلّم لوحة التحكم المعلّقين الذين تقلّ نسبة صمودهم عن 60% على مسابر الثبات.

مبرّرات الحدود

وحين ينقلب تصنيف فعلاً، يذكر المعلّق ما الذي تجاوز الخط الفاصل: "please تليّن الأمر". وتتراكم تلك المبرّرات فتصير خريطة لمواضع النقص في تحديد إرشادك، وهي مُدخَل إرشاد أفضل.

وتعرض لوحة التحكم أيضاً حساسية الحدّ بحسب التصنيف: من بين التعديلات الدنيا الموجّهة لكل تصنيف، ما نسبة ما انقلب منها فعلاً. فالتصنيف الذي معدّل انقلابه 90% يقف على حدّ السكين وربما يحتاج تعريفاً أوضح. والتصنيف عند 10% متين.

أيّهما ينبغي أن تستخدم؟

هما يجيبان عن سؤالين مختلفين، وهما يتركّبان.

Truth Serumمختبر الحدود
يجدالعناصر التي يُرجَّح أن الجمهور أخطأ فيهاالإرشادات الملتبسة؛ المعلّقين غير المنتبهين
يكلّف المعلّقشريط تمرير واحد لكل عنصرنقرة واحدة لكل مسبار
ينتجأحكاماً أفضل، ودرجات معايرةمجموعات تباين، ومبرّرات حدود
يحتاج LLMلالا (طبقة قائمة على القواعد)

إن كان همّك "قد يكون تصنيف الإجماع خاطئاً في الحالات الصعبة"، فابدأ من Truth Serum. وإن كان "لا أظن دليل الترميز عندي دقيقاً بما يكفي، ولستُ واثقاً أن الجميع يقرؤون"، فابدأ من مختبر الحدود.

ولا يغني أي منهما عن القياس النفسي، الذي يخبرك بمقدار الثقة التي تستحقها كل تصنيفة وبأي المعلّقين ينبغي ترجيحهم. والثلاثة معاً يعطونك دراسة تُقاس فيها الجودة باستمرار بدل أن تُفحَص بالعيّنة، ولا يعتمد فيها أي قياس على مفتاح إجابات كان عليك بناؤه أولاً.

قراءات إضافية