रेटिंग स्केल और Likert डिज़ाइन
एनोटेशन के लिए रेटिंग स्केल कैसे डिज़ाइन करें: Likert बनाम slider, कितने बिंदु रखें, acquiescence bias से कैसे बचें, और Potato में रेटिंग कार्य कैसे बनाएँ।
रेटिंग स्केल श्रेणी नहीं, मात्रा दर्ज करता है: कितना सकारात्मक, कितना धाराप्रवाह, कितना उपयोगी। इसके दो आम रूप हैं, बिंदुओं वाला Likert scale (जैसे 1–5) और सतत slider। स्केल के छोटे-छोटे डिज़ाइन फ़ैसले आपके डेटा को उससे कहीं ज़्यादा बदल देते हैं जितना लोग सोचते हैं।
Likert: अलग-अलग बिंदु
जब आपको आपस में तुलनीय और आसानी से जोड़ी जा सकने वाली रेटिंग चाहिए, तब Likert स्केल लें:
annotation_schemes:
- annotation_type: likert
name: fluency
description: "How fluent is this translation?"
size: 5
min_label: "Not fluent at all"
max_label: "Perfectly fluent"जो डिज़ाइन फ़ैसले मायने रखते हैं:
- कितने बिंदु? पाँच सुरक्षित डिफ़ॉल्ट है। सात से ज़्यादा बारीकी मिलती है, बशर्ते एनोटेटर उसका इस्तेमाल कर पाएँ। सम संख्या बीच का तटस्थ बिंदु हटा देती है और एक तरफ़ झुकने को मजबूर करती है, जो तब काम का है जब “तटस्थ” बचाव का रास्ता बन रहा हो, और जोखिम भरा तब जब तटस्थता सचमुच मौजूद हो।
- सिरों पर लेबल लगाएँ, और हो सके तो हर बिंदु पर। लेबल वाले बिंदु खाली संख्याओं के मुक़ाबले ज़्यादा एकरूपता से समझे जाते हैं।
- दिशा एक जैसी रखें अपने सभी स्केल में, वरना एनोटेटर आदतन उन्हें उलट देंगे।
Slider: सतत मान
slider तब लें जब जिस चीज़ को नाप रहे हैं वह सचमुच सतत हो, जैसे आत्मविश्वास का प्रतिशत या भावना की तीव्रता:
annotation_schemes:
- annotation_type: slider
name: confidence
description: "How confident are you in your label?"
min_value: 0
max_value: 100
step: 1सतत स्केल बारीकी तो देते हैं पर सहमति गिरा देते हैं, क्योंकि “67 बनाम 72” की इतनी महीन समझ लोगों में साझा नहीं होती। सहमति चाहिए तो आउटपुट को खाँचों में बाँट लें।
जिन bias को ध्यान में रखकर डिज़ाइन करें
- Acquiescence bias: सहमत हो जाने की प्रवृत्ति। बीच-बीच में उलटे शब्दों वाले आइटम रखें, ताकि सहमति डिफ़ॉल्ट न बने। देखें acquiescence bias।
- Central tendency: बीच में जमा हो जाना। सिरों के साफ़ लेबल और, जहाँ ठीक बैठे, बिंदुओं की सम संख्या इसके ख़िलाफ़ काम करती है।
- Anchoring: शुरू के कुछ आइटम ही संदर्भ तय कर देते हैं। शुरुआत में एक छोटा calibration सेट मदद करता है।
अकेले स्केल से आगे
- कई आइटम को एक ही स्केल पर एक साथ अंक दिलाने के लिए
multirateलें (जैसे खोजा गया हर दस्तावेज़)। देखें RAG मूल्यांकन। - कई भारित कसौटियों पर अंक देने के लिए
rubric_evalलें। देखें रूब्रिक-आधारित LLM मूल्यांकन। - MOS जैसी ऑडियो गुणवत्ता रेटिंग भी उसी Likert तंत्र पर चलती है, देखें ऑडियो एनोटेशन।
आगे पढ़ें
- स्कीम की रूपरेखा
- Pairwise और Best–Worst Scaling, जब तुलना रेटिंग से बेहतर काम करे
- इंटर-एनोटेटर सहमति