जोड़ीवार मॉडल तुलना
Potato में दो मॉडलों या दो जवाबों की आमने-सामने तुलना एनोटेटर से कैसे कराएँ, बहु-आयामी तुलना और bias नियंत्रण समेत।
दो मॉडलों में बेहतर कौन है, यह तय करने के लिए एनोटेटर को एक prompt और दोनों जवाब दिखाएँ और पूछें कि जीतता कौन है। कई prompt पर जुटाए गए ये आमने-सामने के निर्णय निरपेक्ष अंकों के मुक़ाबले मॉडल को ज़्यादा भरोसेमंद ढंग से क्रम में लगाते हैं। इंसानी वोटों पर बने सार्वजनिक मॉडल leaderboard इसी तरीक़े पर चलते हैं।
यह pairwise comparison को मॉडल आउटपुट पर लागू करना है; बहुत सारी तुलनाओं को Elo या Bradley–Terry मॉडल से एक ही क्रम में बदला जा सकता है।
बुनियादी आमने-सामने तुलना
annotation_schemes:
- annotation_type: pairwise
name: which_better
description: "Which response is better overall?"
mode: binary
allow_tie: trueबहु-आयामी तुलना
अकेला “बेहतर” trade-off छिपा देता है, मॉडल A ज़्यादा सटीक है पर मॉडल B ज़्यादा साफ़। एक साथ कई आयामों पर तुलना कराएँ:
annotation_schemes:
- annotation_type: pairwise
name: comparison
description: "Compare the two responses on each dimension."
mode: multi_dimensionऔचित्य अनिवार्य कर देने से डेटा जाँचने लायक़ बन जाता है और वे मामले सामने आ जाते हैं जहाँ एनोटेटर ने ग़लत चीज़ को इनाम दे दिया।
Bias पर नियंत्रण
आमने-सामने का डेटा उतना ही अच्छा होता है जितने उसके bias नियंत्रण:
- Position bias: कौन-सा मॉडल “A” की जगह दिखे, इसे randomize करें; वरना एनोटेटर एक ही तरफ़ झुक जाते हैं।
- Length/style bias: गुणवत्ता चाहे जैसी हो, एनोटेटर अक्सर लंबे या ज़्यादा आत्मविश्वास भरे पाठ को चुन लेते हैं। दिशानिर्देशों में इसका नाम लेकर लिखें।
- Verbosity ≠ quality: लंबाई भी दर्ज करने पर सोचें, ताकि जाँचा जा सके कि जीत कहीं उसी से तो नहीं आ रही।
- सहमति: ओवरलैप इकट्ठा करें और इंटर-एनोटेटर सहमति पर नज़र रखें।
तुलना बनाम रूब्रिक
जब आपको क्रम चाहिए और सहमति ऊँची रखनी है, तब जोड़ीवार तुलना लें। जब हर मॉडल का निरपेक्ष, आयाम-दर-आयाम ब्योरा चाहिए, तब रूब्रिक लें। कई मूल्यांकनों में दोनों साथ-साथ चलते हैं।