क्राउड लेबल का एकत्रीकरण: बहुमत वोट से आगे
बहुत सारी शोरभरी एनोटेशन को Dawid-Skene और MACE जैसे एनोटेटर मॉडल की मदद से एक लेबल में कैसे मिलाएँ, उन पर कब भरोसा करें, और Potato दक्षता तथा अनुमानित लेबल कैसे निकालता है।
जब कई लोग एक ही आइटम को लेबल करते हैं, तो उनके उत्तरों को मिलाने का सबसे ज़ाहिर तरीका बहुमत वोट है, और आम तौर पर गलत तरीका भी। हर एनोटेटर की विश्वसनीयता का अनुमान लगाने वाले मॉडल बेहतर लेबल निकालते हैं, spammers को पकड़ते हैं, और बताते हैं कि नतीजे पर कितना भरोसा करना चाहिए। पर उन सबकी मान्यता यही है कि एक ही सही उत्तर होता है, इसलिए व्यक्तिपरक कार्यों में आपको पहले तय करना पड़ता है कि असहमति हटाने लायक त्रुटि है या रखने लायक संकेत। यह मार्गदर्शिका मुख्य एकत्रीकरण मॉडल, उनकी साझा मान्यता, और Potato में एक मॉडल चलाने का तरीका बताती है।
वह समस्या जिसका होना ही बहुमत वोट नहीं मानता
किसी आइटम पर तीन लेबल इकट्ठा कीजिए और बहुमत ले लीजिए। यह तब चलता है जब एनोटेटर लगभग बराबर हों और ज़्यादातर सही हों। जिस पल वे ऐसे नहीं रहते, यह टूट जाता है। बहुमत वोट एक सावधान विशेषज्ञ और बेतरतीब क्लिक करते बॉट, दोनों को एक-एक वोट गिनता है, वोट के बँटवारे को फेंक देता है (2-1 की जीत और 3-0 की सफ़ाई एक जैसी दिखती हैं), और सचमुच कठिन आइटम को आलसी एनोटेटर से अलग करने का कोई रास्ता नहीं देता। यही truth inference की समस्या है: सिर्फ़ लेबल मैट्रिक्स से, एक साथ, छिपा हुआ सही लेबल और हर एनोटेटर की विश्वसनीयता निकालना।
Confusion-matrix मॉडल: Dawid और Skene
बुनियादी विधि लगभग 50 साल पुरानी है। Dawid and Skene (1979) ने हर एनोटेटर को एक confusion matrix से मॉडल किया, यानी वे प्रायिकताएँ कि वह किसी true-positive आइटम को positive लेबल करेगा, negative करेगा, वगैरह, और उन मैट्रिक्स तथा सही लेबल का एक साथ अनुमान लगाने के लिए expectation-maximization का इस्तेमाल किया। जो एनोटेटर दो श्रेणियों के बीच गड़बड़ करता है, उसका confusion matrix यही बताता है, और उस भेद पर उसके वोट का भार उसी हिसाब से घट जाता है। आज के लगभग सारे एकत्रीकरण मॉडल इसी विचार की संतान हैं।
MACE: दक्षता और स्पैम की पहचान
Hovy et al. (2013) ने MACE (Multi-Annotator Competence Estimation) पेश किया, जो इसमें एक स्पष्ट spamming मॉडल जोड़ता है: हर एनोटेटर को या तो उत्तर जानने वाला माना जाता है या अंदाज़ा लगाने वाला, और MACE अनुमान लगाता है कि किसी आइटम पर वह अंदाज़ा लगा रहा था या नहीं। इससे हर एनोटेटर को 0 और 1 के बीच एक दक्षता स्कोर मिलता है, और हर आइटम के लिए एक एन्ट्रॉपी जो सचमुच अस्पष्ट आइटम को उजागर करती है। यह तेज़ है, बेतरतीब क्लिक करने वालों को पकड़ने में अच्छा है, और यही मॉडल Potato के साथ आता है।
बेज़ियन मॉडल और सर्वेक्षणों से मिले प्रमाण
यह क्षेत्र इन दोनों से कहीं आगे बढ़ चुका है। Paun et al. (2018) ने असली डेटासेट पर बेज़ियन एनोटेशन मॉडल के एक परिवार की तुलना की और पाया कि वे लगातार बहुमत वोट से बेहतर रहते हैं, खासकर जब एनोटेटरों की गुणवत्ता में काफ़ी फ़र्क़ हो, और साथ ही ऐसी कैलिब्रेटेड अनिश्चितता देते हैं जिसे आप आगे की प्रक्रिया तक ले जा सकते हैं। इंजीनियरिंग की तरफ़ से, Zheng et al. (2017) ने 17 truth-inference विधियों का बेंचमार्क किया और पूछा कि क्या यह समस्या हल हो चुकी है। छोटा जवाब: कोई एक विधि हर जगह नहीं जीतती, पर उनमें से लगभग सभी बहुमत वोट से बेहतर हैं, और लेबल की गुणवत्ता गिरने के साथ यह फ़ासला बढ़ता जाता है।
वह मान्यता जो इन सबमें साझा है
ऊपर के हर मॉडल की मान्यता यह है कि एक ही सही लेबल होता है और असहमति त्रुटि है। वस्तुनिष्ठ कार्यों के लिए यह ठीक है। व्यक्तिपरक कार्यों के लिए यह बिलकुल उलटा है: आपत्तिजनकता, भावना, या नैतिक निर्णय पर दो एनोटेटर इसलिए असहमत हो सकते हैं कि उन्होंने टेक्स्ट को सचमुच अलग-अलग पढ़ा, और Plank (2022) का तर्क है कि मानव लेबल की यह विविधता अक्सर संकेत होती है, शोर नहीं। इसे एकत्रीकरण में मिटा दीजिए और वही चीज़ हाथ से चली जाएगी जिसने डेटा को दिलचस्प बनाया था। (इस पर विस्तार से असहमति संकेत है, शोर नहीं में लिखा है।)
यहीं से यह मायने रखने लगता है कि एनोटेट किसने किया। NUTMEG (Ivey, Gauch, and Jurgens, 2025) ठीक इसी खिंचाव के लिए बना बेज़ियन मॉडल है: यह एनोटेटर की पृष्ठभूमि की जानकारी से जायज़, व्यवस्थित असहमति को शोर से अलग करता है, प्रशिक्षण डेटा से लापरवाह लेबल हटाता है और वह असहमति बचाए रखता है जो इस बात के साथ चलती है कि एनोटेटर कौन है। यह तभी काम करता है जब आपने वह पृष्ठभूमि पहले इकट्ठा की हो। अगर आप अध्ययन से पहले जनसांख्यिकी सर्वेक्षण चलाते हैं (एनोटेटर जनसांख्यिकी ज़िम्मेदारी से इकट्ठा करना और Potato के survey instruments देखें), तो आपके पास वही एनोटेटर मेटाडेटा होता है जिसकी NUTMEG जैसे मॉडल को ज़रूरत पड़ती है; उसके बिना हर असहमति को या तो पूरी त्रुटि मानना पड़ता है या पूरा संकेत।
Potato में यह कैसे करें
Potato आपके मल्टी-एनोटेटर डेटा पर MACE चलाता है और एडमिन डैशबोर्ड में दक्षता तथा अनुमानित लेबल दिखाता है। यह श्रेणीबद्ध स्कीमा (radio, likert, select, multiselect) पर काम करता है, और अनुमान लगाने लायक कुछ मिले इसके लिए असली ओवरलैप चाहिए, यानी हर आइटम पर कई एनोटेटर।
mace:
enabled: true
trigger_every_n: 10 # re-estimate after every 10 new annotations
min_annotations_per_item: 3 # ignore items with fewer than 3 labels
min_items: 5 # wait for at least 5 eligible itemsचलने के बाद हर एनोटेटर को एक दक्षता स्कोर मिलता है (1.0 के पास हो तो भरोसेमंद, 0.5 से नीचे हो तो शायद spammer) और हर आइटम को एक पूर्वानुमानित लेबल के साथ एक एन्ट्रॉपी मान। कम एन्ट्रॉपी का मतलब मॉडल आश्वस्त है; अधिकतम के पास एन्ट्रॉपी का मतलब कोई सहमति नहीं, और यह आम तौर पर खराब एनोटेटर के बजाय किसी सचमुच कठिन या अधूरी तरह परिभाषित आइटम की ओर इशारा करता है। पूरे विकल्प MACE फ़ीचर संदर्भ में हैं।
दो व्यावहारिक बातें। पहली, एकत्रीकरण उसी ओवरलैप पर करें जो आपने सचमुच इकट्ठा किया है, MACE को हर आइटम पर कई लेबल चाहिए, इसलिए ओवरलैप की योजना अध्ययन से पहले बनाएँ, बाद में नहीं। दूसरी, MACE एक ही लेबल देता है; अगर आपका कार्य व्यक्तिपरक है तो इसके बजाय soft_label स्कीमा से वितरण रखने पर विचार करें, और adjudication तक सिर्फ़ वहीं जाएँ जहाँ सचमुच एक उत्तर चाहिए।
कब एकत्रीकरण करें और कब फैलाव बनाए रखें
एक मोटा नियम:
- वस्तुनिष्ठ कार्य, असली उत्तर-कुंजी मौजूद है → एक लेबल पर एकत्रीकरण करें। MACE या बहुमत वोट लें और आगे बढ़ें।
- लगभग वस्तुनिष्ठ, पर कुछ एनोटेटर भरोसेमंद नहीं → सादे बहुमत वोट के बजाय दक्षता मॉडल (MACE) से एकत्रीकरण करें, ताकि खराब रेटर नतीजे को न मोड़ें।
- व्यक्तिपरक कार्य, असहमति अर्थपूर्ण है → पूरा वितरण रखें (
soft_label), और अगर एनोटेटर मेटाडेटा है तो असहमति को मिटाने के बजाय उसका मॉडल बनाएँ।
आगे पढ़ें
- MACE दक्षता आकलन, API एंडपॉइंट और व्याख्या के साथ फ़ीचर संदर्भ।
- Adjudication और असहमति, उन मामलों को सुलझाने के लिए जिन्हें आप एक लेबल में समेटना तय करते हैं।
- इंटर-एनोटेटर सहमति की व्याख्या, एकत्रीकरण से पहले यह मापने के लिए कि आपके एनोटेटर कितना अलग जा रहे हैं।
- आपको कितने एनोटेटर चाहिए?, उस ओवरलैप के लिए जो एकत्रीकरण को संभव बनाता है।