Skip to content

रूब्रिक-आधारित LLM मूल्यांकन

Potato के रूब्रिक मूल्यांकन प्रकार से LLM के आउटपुट को कई भारित कसौटियों (MT-Bench शैली) पर कैसे परखें।

रूब्रिक एक धुँधले निर्णय (क्या यह अच्छा जवाब है?) को तोड़कर अलग-अलग, अंक दिए जाने लायक कसौटियों में बदल देता है, जैसे उपयोगिता, सटीकता, पूर्णता, लहज़ा, सुरक्षा, और हर कसौटी को एक स्केल पर अंक मिलते हैं। इससे LLM का मूल्यांकन दोहराया जा सकता है और यह भी दिखता है कि एक जवाब दूसरे से क्यों बेहतर है। MT-Bench जैसे बेंचमार्क के पीछे यही ढाँचा है।

रूब्रिक व्यक्तिपरक गुणवत्ता को परिभाषित कसौटियों और स्केल बिंदुओं की एक ग्रिड में बदल देता है, जिससे सहमति बढ़ती है और नतीजे समझ में आते हैं।

रूब्रिक कब लें

  • आउटपुट इतना भरा-पूरा है कि अकेले एक स्कोर में जानकारी खो जाती है।
  • आपको यह जानना है कि कौन-सा पहलू कमज़ोर है (सटीकता या लहज़ा), न कि सिर्फ़ कुल फ़ैसला।
  • आप चाहते हैं कि कसौटियों पर सभी संबंधित पक्ष पहले से सहमत हों।

अगर बस इतना जानना है कि “कौन बेहतर है”, तो pairwise तुलना सस्ती पड़ती है। रूब्रिक तब काम आता है जब आपको निरपेक्ष और कई आयामों वाली तस्वीर चाहिए।

Potato में इसे कैसे सेट करें

yaml
annotation_schemes:
  - annotation_type: rubric_eval
    name: answer_quality
    description: "Rate the answer on each criterion."
    scale_points: 5
    criteria:
      - {name: Helpfulness, description: "Does it address the user's actual need?"}
      - {name: Accuracy,    description: "Is it factually correct?"}
      - {name: Completeness, description: "Does it cover the important points?"}
      - {name: Tone,        description: "Is the style appropriate?"}

Potato इसे एक ग्रिड की तरह दिखाता है: किनारे पर कसौटियाँ और आर-पार स्केल बिंदु। एनोटेटर हर खाने में अंक भरते हैं।

अच्छी कसौटियाँ कैसे लिखें

  • उन्हें एक-दूसरे से स्वतंत्र रखें। आपस में घुली-मिली कसौटियों (“helpful” और “useful”) को लोग एक साथ ही अंक दे देते हैं और शोर बढ़ता है।
  • स्केल को बाँधें। हर कसौटी के लिए बताएँ कि 1 कैसा दिखता है और 5 कैसा, सिर्फ़ कुल मिलाकर सिरे बता देना काफ़ी नहीं।
  • छोटा रखें। चार से छह कसौटियाँ आम तौर पर सही जगह है; लंबे रूब्रिक एनोटेटरों को थका देते हैं और सहमति गिरा देते हैं।

रूब्रिक और LLM-as-judge

जो रूब्रिक आप इंसानों को देते हैं, उसी से किसी “LLM judge” को prompt करके सस्ते में पहले दौर के अंक निकाले जा सकते हैं और फिर इंसान उन्हें जाँचें, ठीक वैसे ही जैसे LLM pre-annotation में होता है। judge को परखने के लिए इंसानों द्वारा अंकित एक नमूना अपने पास रखें, और judge के अपने bias पर नज़र रखें (लंबाई, फ़ॉर्मैटिंग, ख़ुद को तरजीह)।

आगे पढ़ें