Skip to content

كيف تقيس الاتفاق بين حَكَم LLM والموصِّفين البشريين

تحقّق من نموذج LLM بوصفه حَكَمًا في ضوء التسميات البشرية: قارن كابا الحَكَم مع البشر بكابا البشر فيما بينهم، وقِس المعايرة بـ ECE ودرجة براير، واختبر تحيّز الموضع.

لكي تقرّر هل تثق بحَكَم LLM، اطلب من شخصين على الأقل وسم عيّنة من العناصر دون أن يريا إجابات الحَكَم، ثم قارن اتفاق الحَكَم مع هؤلاء الأشخاص باتفاق الأشخاص فيما بينهم. الحَكَم الذي تقترب كابا كوهين بينه وبين البشر من كابا البشر فيما بينهم يؤدي تقريبًا كما يؤدي موصِّف إضافي. أما الذي يقع دونها بكثير فلا.

نموذج LLM بوصفه حَكَمًا هو نموذج لغوي يُطلب منه تقييم المخرجات، عادةً وفق معايير محدّدة. وتقيس كابا كوهين الاتفاق بين مقيِّمَين، مصحَّحًا للاتفاق المتوقع بالصدفة. ويكون الحَكَم معايَرًا حين تطابق ثقته عدد المرات التي يصيب فيها: فمن الأحكام التي يصدرها بثقة 80%، ينبغي أن يصحّ نحو 80%.

لماذا لا تكفي الدقة مقارنةً بشخص واحد

أول فحص معتاد هو الدقة. توسم بنفسك بضع مئات من العناصر وتعدّ كم مرة يتفق معك الحَكَم. لهذا الرقم مشكلتان. فهو يعامل تسميات شخص واحد على أنها الحقيقة، بما فيها أخطاؤه، وهو غير مصحَّح للصدفة، فالحَكَم الذي يصف كل إجابة بأنها "مفيدة" يحصل على نتيجة جيدة في مجموعة بيانات معظم إجاباتها مفيدة.

تحلّ كابا المشكلة الثانية. ويحلّ الموصِّف البشري الثاني المشكلة الأولى، لأن الخلاف بين شخصين حريصين يُظهر ما تسمح به المهمة نفسها، ولا يمكن مطالبة الحَكَم بأكثر من ذلك.

قارن الحَكَم باتفاق البشر فيما بينهم

أبلغ عن ثلاثة أنواع من الأزواج: إنسان مع إنسان، وحَكَم مع إنسان، وحَكَم مع حَكَم حين تقارن عدة حكّام. إذا اتفق شخصان عند κ = 0.62، فإن حَكَمًا عند 0.60 مع كل منهما يتصرف كموصِّف ثالث، ومطالبته بـ 0.9 مطالبة بأكثر مما تسمح به المهمة. أما حَكَم عند 0.35 فلا يتفق مع البشر، مهما بدت دقته الخام جيدة.

أجرى Zheng وآخرون (2023) المقارنة نفسها على MT-Bench، ووجدوا أن اتفاق GPT-4 مع التفضيلات البشرية يضاهي الاتفاق بين البشر.

ومع أكثر من إنسانين، أو مع عناصر تنقصها بعض التسميات، أبلغ عن كابا فلايس أو ألفا كريبندورف عبر جميع المقيِّمين إلى جانب قيم كابا الزوجية. ويتناول شرح الاتفاق بين الموصِّفين هذا الاختيار.

أبقِ البشر عُميانًا عن الحَكَم

إذا رأى الموصِّفون إجابة الحَكَم تعلّقوا بها، فيصبح جزء من الاتفاق الذي تقيسه اتفاقَ الحَكَم مع نفسه. اجمع التسميات البشرية دون أن تكون إجابات الحَكَم على الشاشة. والأثر نفسه يرفع الاتفاق حين يراجع الموصِّفون توسيمات مسبقة من نموذج. راجع كشف التوسيمات المسبقة المقبولة دون مراجعة.

افحص الثقة إلى جانب الأحكام

قد يتفق الحَكَم مع البشر ومع ذلك يكون مفرط الثقة. وإذا كانت ثقته هي ما يحدّد العناصر التي تُحال إلى إنسان، فإن الإفراط في الثقة يسمح للعناصر الخاطئة بتجاوز المراجعة.

الثقة التي يعلنها النموذج عن نفسه نصٌّ مولَّد كبقية إجابته. أما أخذ العيّنات فيعطي ثقة تجريبية: استعلم الحَكَم k مرة لكل عنصر بدرجة حرارة أعلى من الصفر، وخذ الإجابة الأكثر تكرارًا حكمًا له، ونسبة العيّنات التي أعطت تلك الإجابة ثقةً له. وعند درجة حرارة 0 تكون العيّنات k متطابقة وكل ثقة تساوي 1.0.

يجمع خطأ المعايرة المتوقع (ECE) الأحكام في مجموعات بحسب الثقة، ويقارن ثقة كل مجموعة بدقتها. ودرجة براير هي متوسط مربع الفرق بين الثقة والنتيجة. ويرسم مخطط الموثوقية المجموعات مقابل القطر الذي سيتبعه حَكَم معايَر تمامًا.

اختبر تحيّز الموضع لدى حكّام المقارنة الزوجية

قد يفضّل الحَكَم الذي يقارن إجابتين أيّهما جاءت أولًا، أو ثانيًا، بصرف النظر عن المحتوى. وقد وثّق Zheng وآخرون تحيّز الموضع هذا لدى حكّام LLM. شغّل كل زوج مرتين مع تبديل الترتيب. فالحكم الذي ينقلب حين ينقلب الترتيب حسمه الموضع، ونسبة الأزواج التي تبقى متسقة مكانها في التقرير إلى جانب الاتفاق. راجع المقارنة الزوجية بين النماذج.

المقاييس المرتّبة

على مقياس من 1 إلى 5، الحَكَم الذي يقول 4 حيث يقول الإنسان 5 قد اتفق تقريبًا. أما كابا البسيطة فتحسب ذلك كما تحسب 1 مقابل 5. استخدم كابا الموزونة أو ألفا كريبندورف بمقياس ترتيبي أو فئوي، وأبلغ عن متوسط الخطأ المطلق إلى جانبها. راجع مقاييس التقييم.

كم عنصرًا تسم

لكابا المحسوبة على 50 عنصرًا فترة ثقة واسعة، واسعة بما يكفي لأن يبدو حَكَمان مختلفين حين يكون الفرق مجرد ضجيج. أبلغ عن الفترة مع التقدير، وحدّد حجم العيّنة البشرية قبل أن تبدأ؛ ويبيّن القوة الإحصائية لدراسات التوصيف كيف. وتقسيم العيّنة طبقيًا بحسب تسمية الحَكَم يُبقي الفئات النادرة فيها.

كيف تفعل ذلك في Potato

تشغّل معايرة الحكّام في Potato كل حَكَم k مرة لكل عنصر، وتحفظ تسمياته في مخزن منفصل فلا يراها الموصِّفون أبدًا. ثم تسحب عيّنة عشوائية أو طبقية للوسم البشري الأعمى وتكتب تقريرًا.

yaml
annotation_schemes:
  - annotation_type: radio
    name: helpfulness
    description: "Is this response helpful?"
    labels: [helpful, unhelpful]
 
judge_calibration:
  enabled: true
  prompt: |
    You are an impartial expert annotator. Classify the response as exactly
    one of: helpful, unhelpful.
  models:
    - endpoint_type: ollama
      model: llama3.1:8b
      base_url: http://localhost:11434
      temperature: 0.7
  k_samples: 5
  sampling:
    strategy: stratified
    sample_size: 200
    seed: 42
  human:
    num_raters: 2
    gold: majority
  schemas: [helpfulness]

يعطي التقرير الدقة والضبط والاستدعاء وF1 لكل نموذج مقابل التسمية المرجعية البشرية، وκ كوهين مقسّمة إلى أزواج إنسان–نموذج ونموذج–نموذج وإنسان–إنسان. ويضيف κ فلايس وα كريبندورف عبر جميع المقيِّمين، وECE مع خانات الموثوقية ودرجة براير، ومصفوفة التباس لكل نموذج. وفي مخططات ليكرت يضيف متوسط الخطأ المطلق وα الترتيبية. ومنذ الإصدار 2.9 تعرض بطاقة تقييم الحَكَم أيضًا الاتساق عند تبديل الموضع، ويمكن قراءة التسميات المولَّدة عند /judge_calibration/results قبل انتهاء المرحلة البشرية.

تسرد معايرة نموذج LLM بوصفه حَكَمًا كل الخيارات. ويتناول مواءمة الحَكَم ضبط معايير حَكَم واحد مقابل مجموعة مرجعية موجودة.

أدوات أخرى

يتيح كلٌّ من LangSmith وLangfuse وGalileo مواءمة الحَكَم مع التصحيحات البشرية. ويحسب Langfuse κ كوهين بين درجة بشرية ودرجة حَكَم، لسلسلتين في كل مرة. وتُظهر الخطط المدفوعة في Label Studio مواضع اتفاق الموصِّفين ونماذج LLM. راجع مقارنة أدوات تقييم وكلاء الذكاء الاصطناعي.

الأسئلة الشائعة

ما قيمة كابا الجيدة بين حَكَم LLM والبشر؟

لا توجد عتبة ثابتة. قارن كابا الحَكَم مع البشر بكابا إنسانين على العناصر نفسها. فالحَكَم القريب من قيمة البشر فيما بينهم يتفق مع الناس تقريبًا كما يتفق موصِّف آخر. أما القاعدة التقريبية المعتادة لـ κ وα، أي 0.8 فأكثر للاعتماد و0.67 إلى 0.8 للاستنتاجات المبدئية، فتصف المهمة ككل، والمهمة الصعبة تضع سقفًا لما يمكن أن يبلغه أي حَكَم.

هل ينبغي أن يرى الموصِّفون إجابة حَكَم LLM؟

ليس وأنت تقيس الاتفاق. فالموصِّفون الذين يرون حكم الحَكَم يميلون إلى التعلّق به، مما يضخّم الاتفاق الظاهري للحَكَم. اعرض الحكم فقط بعد وسم عيّنة المعايرة، إن عرضته أصلًا.

كيف أفحص حَكَم LLM بحثًا عن تحيّز الموضع؟

اعرض كل زوج مرتين، مرة بكل ترتيب، وعُدّ كم مرة يتغيّر الحكم مع الترتيب. أبلغ عن نسبة الأزواج المتسقة إلى جانب الاتفاق، واستبعد الأزواج التي ينقلب فيها الحكم أو أعد تشغيلها.

ما خطأ المعايرة المتوقع لحَكَم LLM؟

يقيس ECE الفجوة بين ثقة الحَكَم ودقته. تُجمع الأحكام بحسب الثقة، وECE هو متوسط الفرق بين ثقة كل مجموعة ونسبة أحكامها التي طابقت التسمية البشرية، موزونًا بحجم المجموعة. والحَكَم المعايَر جيدًا يكون ECE لديه قريبًا من الصفر.

قراءات إضافية