Skip to content

विशेषज्ञ बनाम क्राउड एनोटेशन

क्राउड एनोटेटर कब विशेषज्ञों की बराबरी करते हैं, प्रति आइटम कितने चाहिए, हर तरीक़े की लागत क्या है, और बहुमत के भरोसे रहने के बजाय एनोटेटर की क्षमता का मॉडल कैसे बनाएँ।

क्राउड एनोटेटर तब इस्तेमाल करें जब आपके दिशानिर्देशों को ध्यान से पढ़ने वाला कोई ग़ैर-विशेषज्ञ वही निर्णय देगा जो कोई विशेषज्ञ देता, और हर आइटम पर एक के बजाय कई निर्णय इकट्ठे करें। Snow et al. (2008) ने पाया कि पाँच प्राकृतिक भाषा कार्यों में औसतन चार ग़ैर-विशेषज्ञ एनोटेशन एक अकेले विशेषज्ञ एनोटेटर की सहमति के बराबर रहे।

विशेषज्ञ और क्राउड के बीच के चुनाव को आम तौर पर गुणवत्ता और लागत के बीच की अदला-बदली के रूप में रखा जाता है, और ज़्यादातर कामों के लिए यह ढाँचा ग़लत है। असली सवाल यह है कि निर्णय उस प्रशिक्षण पर निर्भर है या नहीं जो क्राउड के पास नहीं है। भाव, पाठीय निहितार्थ और शब्द-समानता ज़्यादातर निर्भर नहीं हैं। नैदानिक कोडिंग, विधिक वर्गीकरण और ध्वन्यात्मक प्रतिलेखन ज़्यादातर निर्भर हैं।

प्रमाण किस बात का समर्थन करते हैं

बुनियादी नतीजा Snow et al. (2008) से आता है, जिन्होंने Amazon Mechanical Turk के ग़ैर-विशेषज्ञ एनोटेशन की तुलना विशेषज्ञों के गोल्ड स्टैंडर्ड से की, और यह भाव-पहचान, शब्द-समानता, पाठीय निहितार्थ की पहचान, घटनाओं के कालक्रम और शब्द-अर्थ विसंदिग्धीकरण पर किया। सभी कार्यों को मिलाकर वे बताते हैं कि "एक अकेले विशेषज्ञ एनोटेटर के बराबर ITA पाने के लिए प्रति उदाहरण केवल 4 ग़ैर-विशेषज्ञ एनोटेशन चाहिए" ("it requires only 4 non-expert annotations per example to achieve the equivalent ITA as a single expert annotator")। लागत के लिए वे अनुपात नहीं, बल्कि एक दर देते हैं: उन्होंने दो डॉलर में 7,000 भाव-एनोटेशन इकट्ठे किए और उसे "प्रति USD कम से कम 875 विशेषज्ञ-तुल्य लेबल" ("at least 875 expert-equivalent labels per USD") बताया।

उस औसत के भीतर कार्य-दर-कार्य फ़र्क़ औसत से ज़्यादा मायने रखता है। उनके भाव वाले काम में क्रोध, घृणा और उदासी दो ग़ैर-विशेषज्ञों के साथ ही विशेषज्ञ स्तर तक पहुँच गए, आश्चर्य के लिए नौ लगे, और भय उन दस एनोटेटरों के भीतर कभी नहीं पहुँचा जितने उन्होंने इकट्ठे किए थे। कार्य-स्तर का औसत उन लेबलों को छिपा देता है जहाँ क्राउड प्रशिक्षण की जगह नहीं ले सकती।

Callison-Burch (2009) ने मशीनी अनुवाद के मूल्यांकन में यही पैटर्न पाया: उन्होंने दस डॉलर में WMT08 के निर्णय दोबारा तैयार किए और बताया कि मिलाए गए ग़ैर-विशेषज्ञ निर्णय "विशेषज्ञ निर्णयों से Bleu की तुलना में ज़्यादा मज़बूती से सहसंबद्ध हैं" ("correlate more strongly with expert judgments than Bleu does")।

दूसरी ओर का पलड़ा यह है कि विशेषज्ञ कभी-कभी ज़्यादा तेज़ होते हैं। Alfter et al. (2022) ने दूसरी भाषा के वक्ताओं, भाषा-पेशेवरों और CEFR विशेषज्ञों के साथ बहु-शब्द अभिव्यक्तियों पर एक best-worst scaling कार्य चलाया। तीनों समूहों की वरीयता-सूचियाँ आपस में ख़ूब सहसंबद्ध रहीं, यानी गुणवत्ता तुलनीय थी, पर सीधे विशेषज्ञ एनोटेशन में प्रति परियोजना 15 से 90 मिनट लगे, जबकि क्राउड वाले संस्करण में लगभग आठ से नौ घंटे, जिसे वे "कम से कम पाँच गुना तेज़" ("at least five times as fast") बताते हैं। जहाँ थोड़े-से विशेषज्ञ पहले से उपलब्ध हों, वहाँ काम को क्राउड की ओर मोड़ने में बचत से ज़्यादा समय लग सकता है।

तंत्र अतिरेक है, क्राउड नहीं

ऊपर के हर अध्ययन में क्राउड का एक अकेला निर्णय विशेषज्ञ के एक अकेले निर्णय से कमतर है। खाई को पाटने वाली चीज़ है हर आइटम पर कई निर्णय इकट्ठे करके उन्हें मिलाना, इसलिए डिज़ाइन का सवाल यह है कि उन्हें मिलाया कैसे जाए।

बहुमत हर एनोटेटर को बराबर भरोसेमंद मानता है, जो वे हैं नहीं। इसके बजाय दो मॉडल विश्वसनीयता का अनुमान आँकड़ों से ही लगाते हैं। Dawid and Skene (1979) ने एक एक्सपेक्टेशन-मैक्सिमाइज़ेशन प्रक्रिया पेश की जो हर प्रेक्षक के लिए एक कन्फ़्यूज़न मैट्रिक्स और साथ में छिपे हुए सही लेबल दोनों का अनुमान लगाती है; मूल रूप से यह नैदानिक प्रेक्षक-त्रुटि के लिए थी। MACE, यानी Multi-Annotator Competence Estimation, क्राउडसोर्सिंग के लिए बनाया गया आइटम-रिस्पॉन्स मॉडल है, जो बिना पर्यवेक्षण के सीखता है कि कौन-से एनोटेटर भरोसेमंद हैं और अंतर्निहित लेबलों का पूर्वानुमान लगाता है। इसके लेखकों ने इसे इसलिए बनाया क्योंकि "कुछ एनोटेटर अपनी कमाई बढ़ाने के लिए ख़राब लेबल चुनते हैं" ("some annotators choose bad labels in order to maximize their pay"), और यह ख़राबी, जब काफ़ी एनोटेटर एक-सी हरकत करें, बहुमत चुपचाप सोख लेता है।

Potato में दोनों मौजूद हैं। mace ब्लॉक इकट्ठा किए गए एनोटेशन पर क्षमता का अनुमान चलाता है, और Dawid-Skene कैलकुलेटर आपके चिपकाए गए लेबलों पर यह अनुमानक चलाता है।

yaml
mace:
  enabled: true
 
num_annotators_per_item: 4
 
gold_standards:
  enabled: true
 
attention_checks:
  enabled: true

num_annotators_per_item: 4 किसी घरेलू डिफ़ॉल्ट का नहीं, बल्कि Snow et al. के नतीजे का पालन करता है, और यह वह मान है जिसे परियोजना-दर-परियोजना ढोने के बजाय हर काम के लिए दोबारा परखना चाहिए। गोल्ड स्टैंडर्ड और ध्यान-जाँच उस एनोटेटर को पकड़ लेते हैं जो पढ़ ही नहीं रहा, और क्षमता-मॉडल इसे तब बेहतर सँभालते हैं जब उनके पास अंशांकन के लिए कुछ स्थिर आइटम हों।

असहमति अपने आप त्रुटि नहीं है

हर असहमति को गुणवत्ता की समस्या मानने से हस्तक्षेप ग़लत दिशा में चला जाता है। Plank et al. (2014) ने शब्द-भेद एनोटेशन में एनोटेटरों की असहमतियों का विश्लेषण किया और पाया कि "एनोटेटरों के केवल 2% चयन ही भाषावैज्ञानिक रूप से अप्रेरित हैं" ("only 2% of annotator choices are linguistically unmotivated"), और निष्कर्ष निकाला कि अधिकांश असहमतियाँ त्रुटियों से नहीं, बल्कि भाषावैज्ञानिक रूप से बहस-योग्य मामलों से आती हैं।

Pavlick and Kwiatkowski (2019) ने जाँचा कि प्राकृतिक भाषा अनुमान में असहमति और आँकड़े जुटाने पर ग़ायब होती है या नहीं, और वह नहीं होती। वे बताते हैं कि असहमतियाँ "एनोटेशन के 'शोर' के रूप में ख़ारिज करने लायक़ नहीं हैं, बल्कि तब भी बनी रहती हैं जब हम और रेटिंग इकट्ठी करते हैं और जब हम मूल्यांकनकर्ताओं को दिए जाने वाले संदर्भ की मात्रा बदलते हैं" ("are not dismissible as annotation 'noise', but rather persist as we collect more ratings and as we vary the amount of context provided to raters")। Plank (2022) इसी बात को मानवीय लेबल-विचरण के रूप में सामान्यीकृत करती हैं।

व्यावहारिक जाँच सस्ती है। जिन आइटमों पर एनोटेटर बँटे हुए हैं, उन पर और निर्णय इकट्ठे करें। अगर सहमति अभिसरित हो जाती है, तो असहमति शोर थी और अतिरेक उसे ठीक कर देता है। अगर वह सपाट बनी रहती है, तो आइटम सचमुच अस्पष्ट है, और सही प्रतिक्रिया यह है कि एक ही लेबल थोपने के बजाय वितरण दर्ज किया जाए।

प्रशिक्षण, एनोटेटर के प्रकार से ज़्यादा सहमति बदलता है

Bayerl and Paul (2011) ने शब्द-अर्थ विसंदिग्धीकरण, स्वरात्मक प्रतिलेखन और ध्वन्यात्मक प्रतिलेखन के 96 एनोटेशन अध्ययनों का मेटा-विश्लेषण किया, जिसमें 346 सहमति-सूचकांक शामिल थे। सहमति में भिन्नता को सात कारक समझाते थे, और उनमें से दो प्रशिक्षण से जुड़े हैं, यानी एनोटेटरों को प्रशिक्षण मिला या नहीं और वह कितना सघन था। बाक़ी हैं एनोटेशन का क्षेत्र, स्कीमा में श्रेणियों की संख्या, एनोटेटरों की संख्या, एनोटेशन का उद्देश्य, और प्रतिशत सहमति निकालने की विधि।

यह नतीजा विशेषज्ञ-बनाम-क्राउड के फ़ैसले को नए सिरे से रखता है। कम श्रेणियों वाली, परखी हुई स्कीमा पर काम करने वाला प्रशिक्षित क्राउड एनोटेटर अक्सर उस अप्रशिक्षित विशेषज्ञ से ज़्यादा सहमति दिखाएगा जो किसी धुँधली स्कीमा पर काम कर रहा है। सहमति के लिए भर्ती के माध्यम से ज़्यादा काम एनोटेशन दिशानिर्देश लिखना और एनोटेशन स्कीमा चुनना करते हैं।

क्राउड एनोटेशन कहाँ विफल होता है

तीन स्थितियाँ क्राउड को ग़लत विकल्प बना देती हैं। निर्णय के लिए प्रमाणित ज्ञान चाहिए, जैसे नैदानिक या विधिक कोडिंग में, जहाँ ग़लत लेबल महज़ शोर नहीं होता। आँकड़े आपके ढाँचे से बाहर नहीं जा सकते, जिससे गुणवत्ता चाहे जो हो, सार्वजनिक मार्केटप्लेस बाहर हो जाता है। लेबल-समुच्चय इतना बड़ा या श्रेणीबद्ध है कि प्रति एनोटेटर प्रशिक्षण की लागत बचत से ज़्यादा हो जाती है, जो मोटे तौर पर कुछ दर्जन श्रेणियों से ऊपर आम है।

जब पहली स्थिति लागू हो पर मात्रा बड़ी हो, तो मिला-जुला डिज़ाइन आम तौर पर दोनों छोरों से बेहतर रहता है। विशेषज्ञ एक उपसमुच्चय पर लेबल लगाते हैं, वह उपसमुच्चय गोल्ड स्टैंडर्ड बन जाता है, और क्राउड एनोटेटर असली काम तक पहुँचने से पहले उसी पर छाने जाते हैं। छानने की प्रक्रिया गोल्ड स्टैंडर्ड और ध्यान-जाँच में दी गई है।

आगे पढ़ें

संदर्भ

Snow, R., O'Connor, B., Jurafsky, D., and Ng, A. Y. (2008). Cheap and Fast – But is it Good? Evaluating Non-Expert Annotations for Natural Language Tasks. Proceedings of EMNLP 2008, 254-263. https://aclanthology.org/D08-1027/

Callison-Burch, C. (2009). Fast, Cheap, and Creative: Evaluating Translation Quality Using Amazon's Mechanical Turk. Proceedings of EMNLP 2009, 286-295. https://aclanthology.org/D09-1030/

Dawid, A. P., and Skene, A. M. (1979). Maximum Likelihood Estimation of Observer Error-Rates Using the EM Algorithm. Journal of the Royal Statistical Society. Series C (Applied Statistics), 28(1), 20-28. https://doi.org/10.2307/2346806

Hovy, D., Berg-Kirkpatrick, T., Vaswani, A., and Hovy, E. (2013). Learning Whom to Trust with MACE. Proceedings of NAACL-HLT 2013, 1120-1130. https://aclanthology.org/N13-1132/

Plank, B., Hovy, D., and Søgaard, A. (2014). Linguistically debatable or just plain wrong? Proceedings of ACL 2014 (Volume 2: Short Papers), 507-511. https://doi.org/10.3115/v1/P14-2083

Pavlick, E., and Kwiatkowski, T. (2019). Inherent Disagreements in Human Textual Inferences. Transactions of the Association for Computational Linguistics, 7, 677-694. https://aclanthology.org/Q19-1043/

Bayerl, P. S., and Paul, K. I. (2011). What Determines Inter-Coder Agreement in Manual Annotations? A Meta-Analytic Investigation. Computational Linguistics, 37(4), 699-725. https://doi.org/10.1162/COLI_a_00074

Alfter, D., Lindström Tiedemann, T., and Volodina, E. (2022). Crowdsourcing Relative Rankings of Multi-Word Expressions: Experts versus Non-Experts. Northern European Journal of Language Technology, 7(1). https://doi.org/10.3384/nejlt.2000-1533.2021.3128

Plank, B. (2022). The "Problem" of Human Label Variation: On Ground Truth in Data, Modeling and Evaluation. Proceedings of EMNLP 2022, 10671-10682. https://doi.org/10.18653/v1/2022.emnlp-main.731