रूब्रिक-आधारित LLM मूल्यांकन
Potato के रूब्रिक मूल्यांकन प्रकार से LLM के आउटपुट को कई भारित कसौटियों (MT-Bench शैली) पर कैसे परखें।
रूब्रिक एक धुँधले निर्णय (क्या यह अच्छा जवाब है?) को तोड़कर अलग-अलग, अंक दिए जाने लायक कसौटियों में बदल देता है, जैसे उपयोगिता, सटीकता, पूर्णता, लहज़ा, सुरक्षा, और हर कसौटी को एक स्केल पर अंक मिलते हैं। इससे LLM का मूल्यांकन दोहराया जा सकता है और यह भी दिखता है कि एक जवाब दूसरे से क्यों बेहतर है। MT-Bench जैसे बेंचमार्क के पीछे यही ढाँचा है।
रूब्रिक व्यक्तिपरक गुणवत्ता को परिभाषित कसौटियों और स्केल बिंदुओं की एक ग्रिड में बदल देता है, जिससे सहमति बढ़ती है और नतीजे समझ में आते हैं।
रूब्रिक कब लें
- आउटपुट इतना भरा-पूरा है कि अकेले एक स्कोर में जानकारी खो जाती है।
- आपको यह जानना है कि कौन-सा पहलू कमज़ोर है (सटीकता या लहज़ा), न कि सिर्फ़ कुल फ़ैसला।
- आप चाहते हैं कि कसौटियों पर सभी संबंधित पक्ष पहले से सहमत हों।
अगर बस इतना जानना है कि “कौन बेहतर है”, तो pairwise तुलना सस्ती पड़ती है। रूब्रिक तब काम आता है जब आपको निरपेक्ष और कई आयामों वाली तस्वीर चाहिए।
Potato में इसे कैसे सेट करें
annotation_schemes:
- annotation_type: rubric_eval
name: answer_quality
description: "Rate the answer on each criterion."
scale_points: 5
criteria:
- {name: Helpfulness, description: "Does it address the user's actual need?"}
- {name: Accuracy, description: "Is it factually correct?"}
- {name: Completeness, description: "Does it cover the important points?"}
- {name: Tone, description: "Is the style appropriate?"}Potato इसे एक ग्रिड की तरह दिखाता है: किनारे पर कसौटियाँ और आर-पार स्केल बिंदु। एनोटेटर हर खाने में अंक भरते हैं।
अच्छी कसौटियाँ कैसे लिखें
- उन्हें एक-दूसरे से स्वतंत्र रखें। आपस में घुली-मिली कसौटियों (“helpful” और “useful”) को लोग एक साथ ही अंक दे देते हैं और शोर बढ़ता है।
- स्केल को बाँधें। हर कसौटी के लिए बताएँ कि 1 कैसा दिखता है और 5 कैसा, सिर्फ़ कुल मिलाकर सिरे बता देना काफ़ी नहीं।
- छोटा रखें। चार से छह कसौटियाँ आम तौर पर सही जगह है; लंबे रूब्रिक एनोटेटरों को थका देते हैं और सहमति गिरा देते हैं।
रूब्रिक और LLM-as-judge
जो रूब्रिक आप इंसानों को देते हैं, उसी से किसी “LLM judge” को prompt करके सस्ते में पहले दौर के अंक निकाले जा सकते हैं और फिर इंसान उन्हें जाँचें, ठीक वैसे ही जैसे LLM pre-annotation में होता है। judge को परखने के लिए इंसानों द्वारा अंकित एक नमूना अपने पास रखें, और judge के अपने bias पर नज़र रखें (लंबाई, फ़ॉर्मैटिंग, ख़ुद को तरजीह)।