Skip to content

जोड़ीवार तुलना और best–worst scaling

रेटिंग की जगह तुलनात्मक निर्णय कब लें, जोड़ीवार तुलना और best-worst scaling (MaxDiff) क्या हैं, और इन्हें Potato में कैसे सेट करें।

लोग स्थिर निरपेक्ष अंक देने में कमज़ोर होते हैं, पर तुलना करने में अच्छे। तुलनात्मक एनोटेशन इसी का फ़ायदा उठाता है: “इसे 1–5 में अंक दें” के बजाय आप पूछते हैं “A और B में बेहतर कौन है?”। इसके दो मुख्य रूप हैं, जोड़ीवार तुलना और best–worst scaling। आज के AI के लिए वरीयता डेटा इन्हीं पर टिका है।

पृष्ठभूमि के लिए Pairwise comparison और MaxDiff देखें।

जोड़ीवार तुलना

दो आइटम दिखाएँ और पूछें कि जीतता कौन है। यह सीधा तरीक़ा है, इसमें सहमति ऊँची रहती है, और reinforcement learning from human feedback के लिए इंसानी वरीयता डेटा इसी रूप में जुटाया जाता है।

yaml
annotation_schemes:
  - annotation_type: pairwise
    name: preference
    description: "Which response better answers the question?"
    mode: binary
    allow_tie: true
    sequential_key_binding: true

बराबरी का विकल्प रखने से एनोटेटर वहाँ अंतर गढ़ने से बच जाते हैं जहाँ कोई अंतर है ही नहीं। कितना बेहतर, यह भी दर्ज करना हो तो mode को किसी पैमाने पर ले जाएँ (जैसे "A much better … B much better")। जोड़ीवार वरीयता showcase इसका चलता-फिरता उदाहरण है।

बहुत सारे जोड़ीवार निर्णयों को Elo rating system या Bradley–Terry मॉडल जैसे किसी मॉडल से एक ही क्रम में बदला जा सकता है।

Best–worst scaling (MaxDiff)

एक छोटा सेट दिखाएँ (अक्सर चार आइटम) और उसमें से सबसे अच्छा और सबसे ख़राब चुनने को कहें। हर निर्णय एक जोड़ीवार वोट से ज़्यादा जानकारी देता है, क्योंकि इससे सेट के दोनों सिरे एक साथ तय हो जाते हैं।

yaml
annotation_schemes:
  - annotation_type: bws
    name: fluency
    description: "Pick the most and least fluent translation."
    tuple_size: 4
    best_description: "Most fluent"
    worst_description: "Least fluent"

Best–worst scaling साधारण चुनावों से भी भरोसेमंद, अंतराल जैसे अंक निकाल देता है, और कई एनोटेटर के निर्णयों से संतुलित क्रम बनाने में इसका ख़ूब इस्तेमाल होता है।

रेटिंग के बजाय तुलना कब चुनें

  • आपकी अवधारणा को निरपेक्ष रूप से टिकाना मुश्किल हो (हास्य, उपयोगिता, सौंदर्य)।
  • आपको ऊँची सहमति चाहिए और आपका Likert पैमाना शोर भरा है।
  • आप किसी मॉडल को प्रशिक्षित या संरेखित करने के लिए वरीयता डेटा बना रहे हैं।

क़ीमत यह है कि आपको सापेक्ष जानकारी मिलती है; निरपेक्ष अंक निकालने के लिए शायद किसी मॉडल (Elo, Bradley–Terry) की ज़रूरत पड़े।

आगे पढ़ें