Skip to content

जोड़ीवार मॉडल तुलना

Potato में दो मॉडलों या दो जवाबों की आमने-सामने तुलना एनोटेटर से कैसे कराएँ, बहु-आयामी तुलना और bias नियंत्रण समेत।

दो मॉडलों में बेहतर कौन है, यह तय करने के लिए एनोटेटर को एक prompt और दोनों जवाब दिखाएँ और पूछें कि जीतता कौन है। कई prompt पर जुटाए गए ये आमने-सामने के निर्णय निरपेक्ष अंकों के मुक़ाबले मॉडल को ज़्यादा भरोसेमंद ढंग से क्रम में लगाते हैं। इंसानी वोटों पर बने सार्वजनिक मॉडल leaderboard इसी तरीक़े पर चलते हैं।

यह pairwise comparison को मॉडल आउटपुट पर लागू करना है; बहुत सारी तुलनाओं को Elo या Bradley–Terry मॉडल से एक ही क्रम में बदला जा सकता है।

बुनियादी आमने-सामने तुलना

yaml
annotation_schemes:
  - annotation_type: pairwise
    name: which_better
    description: "Which response is better overall?"
    mode: binary
    allow_tie: true

बहु-आयामी तुलना

अकेला “बेहतर” trade-off छिपा देता है, मॉडल A ज़्यादा सटीक है पर मॉडल B ज़्यादा साफ़। एक साथ कई आयामों पर तुलना कराएँ:

yaml
annotation_schemes:
  - annotation_type: pairwise
    name: comparison
    description: "Compare the two responses on each dimension."
    mode: multi_dimension

औचित्य अनिवार्य कर देने से डेटा जाँचने लायक़ बन जाता है और वे मामले सामने आ जाते हैं जहाँ एनोटेटर ने ग़लत चीज़ को इनाम दे दिया।

Bias पर नियंत्रण

आमने-सामने का डेटा उतना ही अच्छा होता है जितने उसके bias नियंत्रण:

  • Position bias: कौन-सा मॉडल “A” की जगह दिखे, इसे randomize करें; वरना एनोटेटर एक ही तरफ़ झुक जाते हैं।
  • Length/style bias: गुणवत्ता चाहे जैसी हो, एनोटेटर अक्सर लंबे या ज़्यादा आत्मविश्वास भरे पाठ को चुन लेते हैं। दिशानिर्देशों में इसका नाम लेकर लिखें।
  • Verbosity ≠ quality: लंबाई भी दर्ज करने पर सोचें, ताकि जाँचा जा सके कि जीत कहीं उसी से तो नहीं आ रही।
  • सहमति: ओवरलैप इकट्ठा करें और इंटर-एनोटेटर सहमति पर नज़र रखें।

तुलना बनाम रूब्रिक

जब आपको क्रम चाहिए और सहमति ऊँची रखनी है, तब जोड़ीवार तुलना लें। जब हर मॉडल का निरपेक्ष, आयाम-दर-आयाम ब्योरा चाहिए, तब रूब्रिक लें। कई मूल्यांकनों में दोनों साथ-साथ चलते हैं।

आगे पढ़ें