كتيبات الترميز للمُعلّقين من الذكاء الاصطناعي: تحويل مخطط ترميز إلى مُصنِّف موثوق بنموذج لغوي
كيف تكتب كتيّب ترميز يستطيع نموذج لغوي اتباعه فعلًا، وتتحقق من تصنيفاته مقابل مرمّزين بشريين، وتُبقي شخصًا في الحلقة، مع إعداد Potato مشروح.
كان كتيّب الترميز لعقود وثيقة تسلّمها إلى أشخاص. يخبر فريقًا من المرمّزين بمعنى كل رمز، وأي الحالات تُحتسب، وأين تقع الحدود الشائكة. أما الآن فالمرمّز الذي يقرؤه صار في الغالب نموذجًا لغويًّا، وكتيّب مكتوب لطالب دراسات عليا في جلسة تدريبه الثالثة لا ينتقل نظيفًا إلى نموذج سيقرأ الكتيّب كله مرة واحدة ولن يسأل سؤال استيضاح أبدًا.
كتيّب الترميز هو العقد بين تصنيفاتك والعالم: لكل رمز، ماذا يعني، وما الذي يُحتسب، وما الذي لا يُحتسب، ومثال أو مثالان. ولاستخدام نموذج لغوي مُعلّقًا تعيد كتابة ذلك العقد بحيث يستطيع نموذج تنفيذه دون أخذ وردّ، ثم تفحص مخرجاته مقابل مرمّزين بشريين قبل أن تثق بها.
ما هو كتيّب الترميز فعلًا
في تحليل المحتوى والبحث النوعي، كتيّب الترميز هو التعريف المشترك لكل رمز في دراسة. والمرجع المعياري هو قالب MacQueen وزملائه لعام 1998، الذي يعطي كل رمز اسمًا وتعريفًا قصيرًا ووصفًا أوفى لمتى ينطبق ومتى لا ينطبق ومقاطع أمثلة. والغاية من تدوين كل ذلك هي الموثوقية: مرمّزان يقرآن الكتيّب نفسه ينبغي أن يبلغا التصنيف نفسه على النص نفسه، وبإمكانك قياس ما إذا كانا يفعلان.
ولكتيبات الترميز مزاجان. الكتيّب الثابت يُستقرّ عليه قبل بدء الترميز، وهكذا تعمل معظم مجموعات تصنيفات تعلّم الآلة ومهام التعهيد الجماعي. والكتيّب الحيّ ينمو أثناء قراءتك، على تقليد النظرية المجذّرة: تلاحظ فكرة متكررة فتسمّيها، ثم تدمج رمزين لاحقًا حين ترى أنهما الشيء نفسه. وكلاهما يصلح لتشغيل مُعلّق من نموذج لغوي، وإن كان على الكتيّب الحيّ أن يتوقف عن الحركة عند نقطة ما قبل أن توسّع النطاق.
لماذا يعطب الكتيّب المصنوع للبشر نموذجًا لغويًّا
المرمّز البشري يملأ فجوات الكتيّب بالحكم وبجلسة التدريب التي ناقشتم فيها الحالات الصعبة. والنموذج لا يملك أيًّا منهما. يقرأ الكلمات على الصفحة، والمواضع التي تركتها ضمنية هي حيث يخطئ.
- حدود غير معرّفة. "رمّز مخاوف التكلفة حين يذكر المشارك المال" يُغفل ما إذا كانت عبارة عابرة مثل "لم يكن رخيصًا" تُحتسب. الإنسان يسأل؛ والنموذج يخمّن، ويخمّن بغير اتساق عبر المدوّنة.
- غياب الأمثلة السلبية. يتعلّم المرمّزون البشريون من "هذا يشبه X لكنه ليس منه" بقدر ما يتعلمون من الحالات الموجبة. ونادرًا ما تدوّن الكتيبات تلك الأمثلة لأن المدرّب يوفّرها شفويًّا.
- حرفية التعليمات. قل لنموذج "طبّق ما يصل إلى ثلاثة رموز" وسيطبّق ثلاثة في الغالب سواء استحق النص ذلك أم لا، محشوًّا حتى السقف. البشر يقرؤون ذلك سقفًا؛ والنماذج تقرؤه هدفًا.
- لا خطوة تقسيم. الإنسان يقسّم النص التفريغي طبيعيًّا إلى وحدات قابلة للترميز. أما النموذج فيجب إخباره بأن يقسّم أولًا ثم يرمّز كل وحدة، وإلا رمّز المقطع كله كتلة واحدة وأضاع الدقّة التي أردتها.
الأربعة كلها قابلة للإصلاح بتحرير كتيّب الترميز، وهذه التحريرات هي ما يحوّل كتيّبًا بشريًّا إلى كتيّب يستطيع نموذج تشغيله.
كتابة كتيّب ترميز يستطيع نموذج لغوي اتباعه
إعادة الكتابة عملية آلية بمجرد أن تعرف ما الذي تضيفه. لكل رمز، اذكر صراحةً الأشياء الأربعة التي كان إنسان سيستنتجها:
- تعريف من سطر واحد بلغة واضحة، لا مرادفًا لاسم الرمز.
- قواعد التضمين: الإشارات التي تعني انطباق الرمز.
- قواعد الاستبعاد: الحالات القريبة التي لا تُحتسب، مع مثال قصير لكل منها.
- مثالان أو ثلاثة حقيقية، ويفضّل أن يكون بينها مثال كان قارئ ساذج سيرمّزه خطأً.
ثم عالج البنية بمعزل عن التصنيفات. اطلب من النموذج أن يقسّم النص إلى وحدات أولًا، وأن يرمّز كل وحدة مقابل الكتيّب، وأن يمتنع حين لا يناسب شيء بدل التقاط أقرب رمز. خيار صريح باسم "لا شيء من هذه" يفيد جودة البيانات أكثر من فقرة تعليمات إضافية، لأنه يعطي النموذج موضعًا يضع فيه الحالات التي لا يغطيها كتيّبك، بدل حشرها في رمز لا تنتمي إليه.
مسألة الموثوقية
أنت تفحص مُعلّقًا من نموذج لغوي لأنك لا تستطيع أن تعرف مسبقًا مدى جودة أدائه. وهو يُبلي حسنًا في عدة مهام راسخة: وجد Gilardi وAlizadeh وKubli (2023) أن ChatGPT ساوى عمال التعهيد الجماعي أو تفوّق عليهم في الصلة والموقف وكشف الأُطُر، باتفاق أعلى بين المرمّزين وتكلفة لكل تصنيف دون السنت. لكن "جيد في تلك المهام" لا يخبرك بشيء عن مهمتك أنت، والسبيل الوحيد لمعرفة ذلك هو القياس.
والقياس هو نفسه الذي كنت ستجريه على مرمّزَين بشريين. دع أشخاصًا يصنّفون عيّنة، ودع النموذج يصنّف العيّنة نفسها، واحسب إحصاءة اتفاق مثل كابا لكوهين أو ألفا لكريبندورف تصحّح للصدفة. فحيث يكون الاتفاق مرتفعًا، يستطيع النموذج حمل الجزء الأكبر من المدوّنة. وحيث يكون منخفضًا، تكون قد وجدت رمزًا تعريفه يؤدي عملًا أقل مما ظننت، والعلاج عادةً في الكتيّب لا في النموذج.
من كتيّب ترميز بشري إلى مُعلّق من نموذج لغوي، مع حلقة التحسين
هناك نمطا إخفاق يستحقان الانتباه. النماذج تُفرِط في تطبيق الرموز حين تعطيها سقفًا ولا تعطيها سببًا للبقاء دونه، فقد يبدو الاتفاق حسنًا على الوجود وينهار على العدد. وحين يتحقق إنسان من النموذج بدل أن يصنّف من جديد، يتسلل تحيّز الأتمتة: إذ إن قبول رمز معقول أسرع من الاعتراض عليه، فينتهي المتحقق إلى المصادقة على أخطاء النموذج. وكلاهما سبب للاحتفاظ بشريحة من التصنيفات البشرية العمياء تمامًا لتكون مقياسك.
إبقاء إنسان في الحلقة
الترتيب العملي هو تقسيم بين النموذج والناس تقرّره من رقم الاتفاق.
وجّه بحسب الاتفاق: اقبل الرموز الواثقة، وأعد الباقي
شغّل النموذج على عيّنة ذهبية مصنّفة، وانظر أين يتفق مع الناس، ووجّه تبعًا لذلك. الرموز التي يصيبها النموذج بموثوقية تمرّ بفحص موضعي خفيف. والرموز التي يخطئها، والوحدات التي امتنع فيها أو بدا غير متيقن، تذهب إلى مرمّزين بشريين. وكلما حسم الناس تلك الحالات، ارتدّت الاختلافات إلى كتيّب الترميز، وكانت الجولة التالية أفضل بفضلها. إنها فكرة الإنسان في الحلقة وراء التعليق المسبق، موسّعة من تصنيف واحد إلى مخطط ترميز كامل.
كيف تفعل ذلك في Potato
يشغّل Potato هذه الحلقة في أداة واحدة: مخطط ترميز مسنود بكتيّب، ونموذج لغوي يعلّق مسبقًا، ومرمّزون بشريون يتحققون، ومقاييس موثوقية على النتيجة. ويعيش كتيّب الترميز داخل مخطط span مُعلَّم بأنه مسنود بكتيّب، وهذا ما يحوّل مجموعة تصنيفات عادية إلى مخطط ترميز هرمي قابل للتحرير.
annotation_schemes:
- annotation_type: span
name: codes
description: Highlight a passage and apply a code from the codebook
labels: [access barriers, cost concerns, provider trust]في وضع QDA يكون كتيّب الترميز open افتراضيًّا، فيستطيع المرمّزون إضافة رموز أو إعادة تسميتها أو دمجها بينما يستقر المخطط. وحالما يصير لديك كتيّب مستقر، حوّله إلى fixed قبل التوسّع، حتى يتوقف المخطط المشترك عن الحركة من تحت النموذج والمرمّزين.
ولجعل نموذج يطبّق الرموز مسبقًا، فعّل دعم الذكاء الاصطناعي ووجّهه إلى النقطة الطرفية التي تستخدمها:
ai_support:
enabled: true
endpoint_type: anthropic # or openai, gemini, ollama, ...
ai_config:
model: claude-opus-4-8
api_key: ${ANTHROPIC_API_KEY}
temperature: 0.2يقترح النموذج رموزًا؛ ويؤكدها المُعلّق أو يصححها. ولإبقاء تحيّز الأتمتة قابلًا للقياس، لا تملأ مسبقًا العناصر التي تحجزها لقياس الاتفاق. اترك شريحة عمياء للبشر وحدهم وقارن مقابلها، كما يصف دليل التعليق المسبق.
وحين تنتهي جولة، يعطيك مُصدِّران المخرجات ومسار التدقيق:
python -m potato.export config.yaml --format codebook -o codebook.csv
python -m potato.export config.yaml --format quotation_report \
--option include_memos=true -o quotations.csvتصدير codebook صف واحد لكل رمز مع وصفه وعدد استخداماته، فترى أي الرموز اتكأ عليها النموذج وأيها لم يُستعمل قط. وquotation_report صف واحد لكل نطاق مرمَّز، وهو الملف الذي تفحص به النموذج فعليًّا. ويبلّغ Potato عن كابا لكوهين وفلايس على الرموز، فتخرج المقارنة بين النموذج والبشر رقمًا يمكنك التبليغ عنه.
إلى أين بعد ذلك
- كتابة إرشادات تعليق فعّالة، الوجه البشري للحرفة نفسها.
- التعليق المسبق بنماذج اللغة والرؤية، لآليات اقتراحات النموذج وضمانات تحيّز الأتمتة.
- شرح اتفاق المُعلّقين، لإحصاءات الموثوقية التي تقرّر التقسيم.
- إدخال الترميز النوعي إلى Potato، لكتيّب الترميز والمذكّرات والحالات التي يقوم عليها سير العمل هذا.
مجموعات البيانات كثيفة كتيبات الترميز تُظهر كيف يبدو المخطط جيّد التحديد عمليًّا: رموز المشاعر الدقيقة في GoEmotions، وأحكام القواعد الاجتماعية في Social Chemistry، وتصنيفات التأطير في Media Frames.