Truth Serum
تسجيل بمبدأ الشائع على نحو مفاجئ للتعليق التوضيحي. سؤال دقيق واحد إضافي بعد كل تصنيف يتيح لـ Potato أن يتفوّق على تصويت الأغلبية في العناصر الصعبة، دون أي تصنيفات ذهبية.
جديد في الإصدار v2.7.0
يفشل تصويت الأغلبية في الموضع نفسه الذي يصعب فيه التعليق التوضيحي: حين يخطئ جمهور واثق ويصيب أقلية مطّلعة. يضيف Truth Serum سؤالاً دقيقاً واحداً بعد كل تصنيف.
اخترتَ Sarcastic. ما النسبة المئوية للمعلّقين الآخرين الذين سيختارون التصنيف نفسه؟

شريط تمرير واحد ونقرة واحدة. وتغذّي تلك التنبؤات مبدأ الشائع على نحو مفاجئ (Prelec 2004؛ Prelec, Seung & McCoy 2017، Nature): التصنيف الذي تتجاوز شعبيته الفعلية شعبيته المتوقعة بأكبر قدر هو أفضل تقدير متاح للحقيقة، ولا يحتاج حسابه إلى أي تصنيفات ذهبية.
والحدس وراء ذلك أن من يحملون رأي أقلية صحيحاً يعرفون عادةً أنهم أقلية، فتنتهي إجابتهم أكثر شيوعاً مما توقّع أي أحد.
وعلى حدّ علمنا، Potato هو أول أداة تعليق توضيحي تتضمن تسجيلاً بتنبؤ الأقران.
ما تحصل عليه
- أحكام على العناصر تتفوّق على تصويت الأغلبية في العناصر الصعبة. يعرض طابور "حيث يُرجَّح أن الجمهور مخطئ" في لوحة التحكم كل عنصر يختلف فيه تصنيفه الشائع على نحو مفاجئ عن تصنيف الأغلبية. راجع هذه أولاً، أو أحلها إلى البتّ.
- درجات معايرة المعلّقين. كم يبعد الاتفاق الذي توقّعه كل معلّق عن الاتفاق الذي ناله فعلاً من أقرانه. فيظهر المعلّقون المفرطون في الثقة وسيّئو المعايرة دون أي أسئلة ذهبية.
- المواءمة مع الحكم الشائع على نحو مفاجئ. كم مرة يطابق تصنيف كل معلّق ذلك الحكم، وهو مؤشر بديل على كونه مطّلعاً لا مجرّد مجارٍ للآخرين.
التهيئة
truth_serum:
enabled: true
schema: sarcasm # scheme to collect predictions for (default: first radio)
min_annotators: 3 # predictions per item before a verdict is computed
# question: "What percentage of other annotators will choose the same label as you?"| الخيار | الافتراضي | الوصف |
|---|---|---|
enabled | false | المفتاح الرئيسي. |
schema | أول مخطط radio | أي مخطط تُجمع توقعات شعبية لتصنيفاته. |
question | انظر أعلاه | النص المعروض فوق شريط التمرير. |
min_annotators | 3 | الحد الأدنى للتنبؤات لكل عنصر قبل حساب الحكم (الحد الأدنى المطلق: 2). |
ملاحظات منهجية
اقرأ هذه قبل الاستشهاد بـ Truth Serum في ورقة بحثية.
- هذه هي الصيغة المبسّطة القائمة على التنبؤ بشعبية الإجابة الذاتية. فيتوقع كل معلّق شعبية التصنيف الذي اختاره هو، لا توزيعاً كاملاً على كل التصنيفات. والشعبية المتوقعة لتصنيف ما هي متوسط تنبؤات مؤيديه، ومفاجأته هي
actual % − predicted %، والحكم هو التصنيف المصوَّت عليه الأكثر مفاجأة. - لا تُحسب الأحكام إلا مع
min_annotatorsتنبؤاً فأكثر. والأحكام عند أعداد صغيرة مشوّشة، و3 حدّ أدنى لا توصية، و5 فأكثر أفضل. - يقارن خطأ المعايرة كل تنبؤ بالاتفاق بين المعلّقين الآخرين على ذلك العنصر، مع استبعاد المعلّق نفسه.
- ويمكن للمعلّقين المراجعة. فآخر زوج (تصنيف، تنبؤ) لكل عنصر هو المعتمد.
البيانات وواجهة برمجة التطبيقات
تُحفظ التنبؤات في {output_annotation_dir}/truth_serum/predictions.jsonl (إلحاق فقط؛ وآخر سجل لكل معلّق وعنصر هو المعتمد).
| نقطة النهاية | الطريقة | الصلاحية | الغرض |
|---|---|---|---|
/truth_serum/api/predict | POST | جلسة | تسجيل التصنيف + النسبة المتوقعة |
/truth_serum/api/mine | GET | جلسة | تنبؤ هذا المعلّق (لاستعادة الأداة) |
/truth_serum/dashboard | GET | مشرف | لوحة تحكم الأحكام والمعايرة |
/truth_serum/api/stats | GET | مشرف | تجميعات لوحة التحكم |
/truth_serum/api/export | GET | مشرف | تصدير JSON كامل (الأحكام + التنبؤات الخام) |
قراءات إضافية
- القياس النفسي — تصنيفات باحتمالات بعدية وفترات ثقة
- مختبر الحدود — مراقبة الجودة انطلاقاً من مسابر مضادة للواقع
- MACE — تقدير الكفاءة، وهو يتركّب مع عرض المعايرة في Truth Serum
- تجميع تصنيفات الجمهور
- الوثائق المصدرية