जोड़ीवार तुलना और best–worst scaling
रेटिंग की जगह तुलनात्मक निर्णय कब लें, जोड़ीवार तुलना और best-worst scaling (MaxDiff) क्या हैं, और इन्हें Potato में कैसे सेट करें।
लोग स्थिर निरपेक्ष अंक देने में कमज़ोर होते हैं, पर तुलना करने में अच्छे। तुलनात्मक एनोटेशन इसी का फ़ायदा उठाता है: “इसे 1–5 में अंक दें” के बजाय आप पूछते हैं “A और B में बेहतर कौन है?”। इसके दो मुख्य रूप हैं, जोड़ीवार तुलना और best–worst scaling। आज के AI के लिए वरीयता डेटा इन्हीं पर टिका है।
पृष्ठभूमि के लिए Pairwise comparison और MaxDiff देखें।
जोड़ीवार तुलना
दो आइटम दिखाएँ और पूछें कि जीतता कौन है। यह सीधा तरीक़ा है, इसमें सहमति ऊँची रहती है, और reinforcement learning from human feedback के लिए इंसानी वरीयता डेटा इसी रूप में जुटाया जाता है।
annotation_schemes:
- annotation_type: pairwise
name: preference
description: "Which response better answers the question?"
mode: binary
allow_tie: true
sequential_key_binding: trueबराबरी का विकल्प रखने से एनोटेटर वहाँ अंतर गढ़ने से बच जाते हैं जहाँ कोई अंतर है ही नहीं। कितना बेहतर, यह भी दर्ज करना हो तो mode को किसी पैमाने पर ले जाएँ (जैसे "A much better … B much better")। जोड़ीवार वरीयता showcase इसका चलता-फिरता उदाहरण है।
बहुत सारे जोड़ीवार निर्णयों को Elo rating system या Bradley–Terry मॉडल जैसे किसी मॉडल से एक ही क्रम में बदला जा सकता है।
Best–worst scaling (MaxDiff)
एक छोटा सेट दिखाएँ (अक्सर चार आइटम) और उसमें से सबसे अच्छा और सबसे ख़राब चुनने को कहें। हर निर्णय एक जोड़ीवार वोट से ज़्यादा जानकारी देता है, क्योंकि इससे सेट के दोनों सिरे एक साथ तय हो जाते हैं।
annotation_schemes:
- annotation_type: bws
name: fluency
description: "Pick the most and least fluent translation."
tuple_size: 4
best_description: "Most fluent"
worst_description: "Least fluent"Best–worst scaling साधारण चुनावों से भी भरोसेमंद, अंतराल जैसे अंक निकाल देता है, और कई एनोटेटर के निर्णयों से संतुलित क्रम बनाने में इसका ख़ूब इस्तेमाल होता है।
रेटिंग के बजाय तुलना कब चुनें
- आपकी अवधारणा को निरपेक्ष रूप से टिकाना मुश्किल हो (हास्य, उपयोगिता, सौंदर्य)।
- आपको ऊँची सहमति चाहिए और आपका Likert पैमाना शोर भरा है।
- आप किसी मॉडल को प्रशिक्षित या संरेखित करने के लिए वरीयता डेटा बना रहे हैं।
क़ीमत यह है कि आपको सापेक्ष जानकारी मिलती है; निरपेक्ष अंक निकालने के लिए शायद किसी मॉडल (Elo, Bradley–Terry) की ज़रूरत पड़े।
आगे पढ़ें
- रेटिंग पैमाने, निरपेक्ष अंक देने वाला विकल्प
- जोड़ीवार मॉडल तुलना, AI आउटपुट की तुलना
- RLHF वरीयता डेटा