Skip to content
Guides6 min read

الحكم على الحَكَم: الاستدلال البشري واستدلال النموذج جنباً إلى جنب

الحَكَم من نوع LLM لا يستحق من الثقة إلا بقدر ما تستحقه التصنيفات البشرية التي تحققتَ منه بها. ضع سلسلة تفكير إنسان بإزاء سلسلة تفكير نموذج على العنصر نفسه، وافحص حَكَمك مقابل تصنيفات تحمل فترات ثقتها الخاصة.

Potato Team

كل من يقيّم نماذج اللغة الكبيرة على نطاق واسع ينتهي به الأمر إلى استخدام LLM بوصفه الحَكَم، وكل واحد ينتهي به الأمر إلى السؤال هل يمكن الوثوق بهذا الحَكَم. والجواب المعتاد هو فحصه مقابل تصنيفات بشرية. لكن ذلك الفحص لا يجود إلا بقدر جودة التصنيفات البشرية، وعبارة "الحَكَم يتفق مع البشر" ادعاء ضعيف إن كان البشر قد اختلفوا فيما بينهم ولم يسجّل أحد مقدار اختلافهم. وهذا المقال عن سدّ تلك الفجوة: قياس كيف يستدل نموذج، وقياس كيف يستدل إنسان، ومقارنة الاثنين بصدق.

يقوم Potato 2.7 على فكرة واحدة: ينبغي لأداة التعليق التوضيحي أن تقيس كيف اتُّخذ الحكم، لا أن تسجّله فحسب. والجزء المثير للاهتمام أن ذلك ينطبق على نوعَي الحَكَم معاً.

مشكلة التحقق من الحَكَم

المسار المعتاد معقول. لديك مهمة أكبر من أن تُصنَّف يدوياً، فتحثّ نموذجاً على تسجيلها. وقبل الوثوق بالدرجات، تأخذ عيّنة، وتجعل بشراً يصنّفونها، وتقيس الاتفاق بين الحَكَم والبشر. وإن كانت Cohen's κ عالية بما يكفي، تطلق.

والنقطة الرخوة هي الخطوة الأخيرة. فتلك κ تقارن حَكَمك بتصنيف بشري واحد، هو عادةً تصويت أغلبية على معلّقَين أو ثلاثة. وتصويت الأغلبية تقدير نقطي بلا شريط خطأ. فهو يقول "sarcastic" بالثقة نفسها تماماً سواء اتفق المعلّقون الثلاثة فوراً أم تغلّب اثنان على ثالث بعد جدال طويل.

فحين تبلّغ أن حَكَمك يتفق مع البشر عند κ = 0.71، تكون تبلّغ عن اتفاق مع رقم لم تقس لايقينه قط. وإن كانت التصنيفات البشرية على العناصر الصعبة أقرب إلى رمي عملة، فإن κ على تلك العناصر تقيس ضوضاء في معظمها، ولن يحرّكها أي قدر من هندسة المحثّات.

وقد كتبنا سابقاً عن آليات معايرة الحَكَم والتوافق بين الحَكَم والبشر. وما يضيفه 2.7 هو النصف الآخر: جعل الجانب البشري من تلك المقارنة يحمل لايقينه الخاص.

أعطِ التصنيفات البشرية أشرطة خطأ أولاً

يلائم محرك القياس النفسي نموذج نظرية استجابة المفردة مع تعليقاتك البشرية، ويبلّغ عن كل تصنيف بوصفه احتمالاً بعدياً مع فترة (sarcastic, p = 0.94 [0.88 – 0.97])، فيزن من صوّت لا عددهم فقط.

ويضيف Truth Serum التسجيل بتنبؤ الأقران، الذي يشير إلى العناصر التي يُرجَّح أن الجمهور أخطأ فيها رغم ثقته.

وعندها يتغير شكل مقارنة الحَكَم. فبدل

الحَكَم يتفق مع تصنيف الأغلبية في 71% من العناصر

يمكنك أن تقول

الحَكَم يتفق مع الاحتمال البعدي البشري في 94% من العناصر التي يكون فيها التصنيف البشري واثقاً (p > 0.9)، وفي 52% من العناصر التي لا يكون فيها كذلك. وتلك العناصر منخفضة الثقة هي 18% من المجموعة.

والعبارة الثانية قابلة للتصرّف بها على نحو لا تتيحه الأولى. فهي تخبرك أن حَكَمك بخير في الحالات السهلة وغير موثوق في الصعبة، وتخبرك بمقدار ما هو صعب من بياناتك. وتخبرك أيضاً بشيء مزعج ومفيد: على العناصر الملتبسة فعلاً، قد لا توجد حقيقة أرضية ليتفق معها الحَكَم، والسعي وراء κ أعلى هناك سعي وراء ضوضاء.

وهذا ما وُجدت له لوحة توافق المُحكِّم مع البشر، وهذا سبب كون ميزات العملية البشرية وميزات تقييم الوكلاء إصداراً واحداً لا اثنين.

سلسلتا تفكير على العنصر نفسه

والنصف الآخر من المقارنة هو الاستدلال نفسه.

يسجّل وضع Think-Aloud كيف يستدل إنسان وصولاً إلى تصنيف. يتحدث المعلّق أثناء عمله؛ ويعمل تحويل الكلام إلى نص محلياً؛ ويُخزَّن النص التفريغي حرفياً وبلا تلخيص، لأن إعادة صياغة بروتوكول التفكير بصوت مسموع تتلف ما كنت تجمعه.

نص تفريغي حرفي للاستدلال المنطوق مع تصنيف صوتي مكشوفسلسلة تفكير بشرية، ملتقَطة حرفياً

ويسجّل تعليق مكافأة العملية كيف يستدل نموذج. إذ تُقسَّم سلسلة تفكير النموذج إلى خطوات، وتنال كل خطوة إشارة مكافأة جيدة أو سيّئة أو محايدة، وهي إشارة التدريب لـنموذج مكافأة العملية.

yaml
annotation_schemes:
  - annotation_type: process_reward
    name: cot_review
    description: "Rate each step of the model's reasoning."
    steps_key: reasoning_steps

العنصر نفسه. سلسلتا تفكير. ضعهما إحداهما بجوار الأخرى.

ما الذي تتعلمه فعلاً من المقارنة

الاستخدام الظاهر هو إيجاد المواضع التي يستدل فيها النموذج على نحو مختلف عن الشخص، ويستحق الأمر تحديداً واضحاً لسبب أهميته.

فتسجيل الإجابة النهائية لا يرى الفرق بين نموذج أصاب الإجابة لسبب صحيح ونموذج أصابها لسبب خاطئ. ففي مهمة سخرية، قد يقول إنسان: "عبارة 'thanks so much' هي التي تؤدي العمل هنا. لا أحد يشكرك بهذه الحرارة على تأخير يومين." وقد يستقر نموذج على التصنيف نفسه لأن النص يحتوي علامة تعجّب. وكلاهما يُعلَّم صحيحاً. لكن واحداً منهما فقط سيعمّم.

ولا تستطيع كشف ذلك من التصنيفات. تستطيع كشفه من الاستدلال، ولهذا يستحق امتلاك الاثنين العناء.

والاستخدام الثاني هو بيانات التدريب. فالخطوات التي يتباعد فيها استدلال الإنسان عن استدلال النموذج هي، بحكم التعريف تقريباً، أعلى الخطوات إشارةً في مجموعة بيانات مكافأة العملية. إنها المواضع التي تكون فيها عملية النموذج خاطئة على نحو لا يكشفه مخرَجه.

قيد واحد بصراحة. يعطيك Potato سطحَي الالتقاط ويضعهما جنباً إلى جنب. لكنه لا يحسب مقياس تشابه آلياً بين سلسلة تفكير إنسان وسلسلة تفكير نموذج، ونحن لم نطلق واحداً عن قصد. فما تعنيه عبارة "أثرا الاستدلال هذان متفقان" سؤال بحثي مفتوح، ورقم نخترعه سيكون أسوأ من لا رقم، لأنه سيبدو ذا سلطة ويعني القليل جداً. الأثر هو المهم؛ أما المقياس فتعريفه لك.

جمع ذلك كله

يبدو مسار تقييم قابل للدفاع عنه في 2.7 قريباً من هذا.

  1. صنّف عيّنة ببشر، مع تفعيل القياس النفسي. فينال كل تصنيف احتمالاً بعدياً وفترة. وتُحدَّد العناصر الملتبسة بوصفها ملتبسة بدل أن تُصنَّف خطأً بصمت.
  2. شغّل Truth Serum لالتقاط العناصر التي يُرجَّح أن جمهوراً واثقاً أخطأ فيها.
  3. أصلح الإرشاد حيث يشير كاشف أخطاء دليل الترميز إلى تمييز سالب، ويفضَّل أن يكون ذلك في غرفة توحيد معايير تستطيع فيها مشاهدة الاتفاق يتحرك كلما تقاربتم.
  4. عايِر الحَكَم مقابل تلك التصنيفات، وبلّغ عن التوافق مشروطاً بالثقة البشرية لا بوصفه رقماً واحداً.
  5. افحص الاستدلال، لا الحكم وحده، على العناصر التي يختلف فيها الحَكَم مع البشر.

وكل خطوة YAML، وقابلة للاستضافة الذاتية، ومجانية. والخطوات من 1 إلى 3 لا تحتاج LLM إطلاقاً.

ولا شيء من هذا يجعل الحَكَم من نوع LLM جديراً بالثقة بذاته. ما يفعله هو أن يجعل ادعاء الجدارة بالثقة ادعاءً حقيقياً: عبارة عليها فترة، مقابل تصنيفات بشرية عليها فترات أيضاً، على عناصر تستطيع أن تقول شيئاً صادقاً عن صعوبتها.

وذلك سقف أدنى من "حَكَمنا متوائم مع القيم الإنسانية"، وأنفع منه بكثير.

قراءات إضافية