Skip to content

LLM जज और मानव एनोटेटरों के बीच सहमति कैसे मापें

किसी LLM-as-a-judge को मानव लेबल पर परखें: जज-मानव kappa की तुलना मानव-मानव kappa से करें, ECE और Brier स्कोर से कैलिब्रेशन मापें, और पोज़िशन बायस की जाँच करें।

किसी LLM जज पर भरोसा करना है या नहीं, यह तय करने के लिए कम से कम दो लोगों से आइटमों का एक सैंपल जज के जवाब देखे बिना लेबल करवाएँ, फिर उन लोगों के साथ जज की सहमति की तुलना लोगों की आपसी सहमति से करें। जिस जज का इंसानों के साथ Cohen का kappa इंसानों के आपसी kappa के क़रीब हो, वह लगभग एक और एनोटेटर जितना अच्छा है। जो उससे काफ़ी नीचे हो, वह नहीं।

LLM-as-a-judge एक भाषा मॉडल है जिसे आउटपुट को ग्रेड करने के लिए प्रॉम्प्ट किया जाता है, आम तौर पर किसी रूब्रिक के आधार पर। Cohen का kappa दो रेटरों के बीच सहमति मापता है, संयोग से अपेक्षित सहमति के लिए सुधार करके। कोई जज कैलिब्रेटेड तब है जब उसका विश्वास इस बात से मेल खाए कि वह कितनी बार सही होता है: जिन फ़ैसलों को वह 80% विश्वास से देता है, उनमें से लगभग 80% सही होने चाहिए।

एक व्यक्ति के मुक़ाबले सटीकता काफ़ी क्यों नहीं

आम तौर पर पहली जाँच सटीकता होती है। आप ख़ुद कुछ सौ आइटम लेबल करते हैं और गिनते हैं कि जज कितनी बार मेल खाता है। इस संख्या में दो समस्याएँ हैं। यह एक व्यक्ति के लेबल को सच मानती है, उसकी ग़लतियों समेत, और यह संयोग के लिए सुधारी हुई नहीं है, इसलिए हर जवाब को "मददगार" कहने वाला जज ऐसे डेटासेट पर अच्छा स्कोर करता है जिसमें ज़्यादातर जवाब मददगार हों।

Kappa दूसरी समस्या हल करता है। दूसरा मानव एनोटेटर पहली समस्या हल करता है, क्योंकि दो सावधान लोगों की असहमति दिखाती है कि कार्य ख़ुद कितनी गुंजाइश देता है, और जज से इससे ज़्यादा की अपेक्षा नहीं की जा सकती।

जज की तुलना इंसानों की आपसी सहमति से करें

तीन तरह की जोड़ियाँ रिपोर्ट करें: मानव के साथ मानव, जज के साथ मानव, और कई जजों की तुलना करते समय जज के साथ जज। अगर दो लोग κ = 0.62 पर सहमत हैं, तो उनमें से हर एक के साथ 0.60 वाला जज तीसरे एनोटेटर जैसा बर्ताव कर रहा है, और उससे 0.9 माँगना कार्य की गुंजाइश से ज़्यादा माँगना है। 0.35 पर खड़ा जज इंसानों से सहमत नहीं है, उसकी कच्ची सटीकता कितनी भी अच्छी दिखे।

Zheng et al. (2023) ने MT-Bench पर यही तुलना की और पाया कि मानव पसंदों के साथ GPT-4 की सहमति इंसानों की आपसी सहमति के बराबर थी।

दो से ज़्यादा इंसान हों, या कुछ आइटमों के लेबल छूटे हों, तो जोड़ीवार kappa के साथ सभी रेटरों पर Fleiss का kappa या Krippendorff का alpha भी रिपोर्ट करें। इंटर-एनोटेटर सहमति की व्याख्या इस चुनाव के बारे में बताती है।

इंसानों को ब्लाइंड रखें

अगर एनोटेटर जज का जवाब देख सकते हैं, तो वे उसी पर टिक जाते हैं, और आप जो सहमति मापते हैं उसका एक हिस्सा जज की ख़ुद से सहमति होता है। मानव लेबल ऐसे जुटाएँ कि जज के जवाब स्क्रीन पर न हों। यही असर तब भी सहमति बढ़ाता है जब एनोटेटर मॉडल के पूर्व-लेबल की समीक्षा करते हैं। देखें बिना जाँचे माने गए पूर्व-लेबल पहचानना

फ़ैसलों के साथ विश्वास भी जाँचें

कोई जज इंसानों से सहमत होकर भी ज़रूरत से ज़्यादा आत्मविश्वासी हो सकता है। अगर उसका विश्वास तय करता है कि कौन-से आइटम इंसान के पास जाएँ, तो ज़्यादा आत्मविश्वास ग़लत आइटमों को समीक्षा से बच निकलने देता है।

मॉडल अपने बारे में जो विश्वास बताता है, वह उसके बाक़ी जवाब की तरह जनरेट किया गया टेक्स्ट ही है। सैंपलिंग एक अनुभवजन्य विश्वास देती है: शून्य से ऊपर के तापमान पर हर आइटम के लिए जज से k बार पूछें, सबसे आम जवाब को उसका फ़ैसला मानें, और उस जवाब वाले सैंपलों के अनुपात को उसका विश्वास। तापमान 0 पर k सैंपल एक-जैसे होते हैं और हर विश्वास 1.0 होता है।

Expected calibration error (ECE) फ़ैसलों को विश्वास के हिसाब से समूहों में बाँटता है और हर समूह के विश्वास की तुलना उसकी सटीकता से करता है। Brier स्कोर विश्वास और नतीजे के बीच का औसत वर्ग अंतर है। रिलायबिलिटी डायग्राम इन समूहों को उस विकर्ण के सामने दिखाता है जिस पर पूरी तरह कैलिब्रेटेड जज चलेगा।

जोड़ी वाले जजों में पोज़िशन बायस परखें

दो जवाबों की तुलना करने वाला जज, सामग्री चाहे जो हो, पहले या दूसरे वाले को पसंद कर सकता है। Zheng et al. ने LLM जजों में इस पोज़िशन बायस को दर्ज किया। हर जोड़ी को दो बार चलाएँ, क्रम बदलकर। जो फ़ैसला क्रम बदलने पर पलट जाए, वह स्थिति से तय हुआ था, और सुसंगत रहने वाली जोड़ियों का अनुपात सहमति के साथ रिपोर्ट में होना चाहिए। देखें जोड़ी में मॉडल तुलना

क्रमबद्ध स्केल

1–5 की रेटिंग पर, जहाँ इंसान 5 कहता है वहाँ 4 कहने वाला जज लगभग सहमत है। सादा kappa इसे 1 बनाम 5 जैसा ही गिनता है। ऑर्डिनल या इंटरवल मेट्रिक के साथ वेटेड kappa या Krippendorff का alpha इस्तेमाल करें, और साथ में माध्य निरपेक्ष त्रुटि रिपोर्ट करें। देखें रेटिंग स्केल

कितने आइटम लेबल करें

50 आइटमों पर निकाले गए kappa का विश्वास अंतराल चौड़ा होता है, इतना कि दो जज अलग दिख सकते हैं जबकि फ़र्क़ सिर्फ़ शोर हो। अनुमान के साथ अंतराल रिपोर्ट करें, और शुरू करने से पहले मानव सैंपल का आकार तय करें; एनोटेशन अध्ययनों के लिए सांख्यिकीय शक्ति बताता है कैसे। जज के लेबल के आधार पर सैंपल को स्तरीकृत करने से दुर्लभ वर्ग उसमें बने रहते हैं।

Potato में यह कैसे करें

Potato का जज कैलिब्रेशन हर जज को हर आइटम पर k बार चलाता है और उसके लेबल अलग स्टोर में रखता है, ताकि एनोटेटर उन्हें कभी न देखें। फिर यह ब्लाइंड मानव लेबलिंग के लिए एक यादृच्छिक या स्तरीकृत सैंपल निकालता है और एक रिपोर्ट लिखता है।

yaml
annotation_schemes:
  - annotation_type: radio
    name: helpfulness
    description: "Is this response helpful?"
    labels: [helpful, unhelpful]
 
judge_calibration:
  enabled: true
  prompt: |
    You are an impartial expert annotator. Classify the response as exactly
    one of: helpful, unhelpful.
  models:
    - endpoint_type: ollama
      model: llama3.1:8b
      base_url: http://localhost:11434
      temperature: 0.7
  k_samples: 5
  sampling:
    strategy: stratified
    sample_size: 200
    seed: 42
  human:
    num_raters: 2
    gold: majority
  schemas: [helpfulness]

रिपोर्ट मानव गोल्ड लेबल के मुक़ाबले हर मॉडल की सटीकता, प्रिसिज़न, रिकॉल और F1 देती है, और मानव–मॉडल, मॉडल–मॉडल तथा मानव–मानव जोड़ियों में बँटा Cohen का κ। इसमें सभी रेटरों पर Fleiss का κ और Krippendorff का α, रिलायबिलिटी बिन के साथ ECE और Brier स्कोर, और हर मॉडल के लिए एक कन्फ़्यूज़न मैट्रिक्स भी होता है। Likert स्कीमों के लिए यह माध्य निरपेक्ष त्रुटि और ऑर्डिनल α जोड़ती है। संस्करण 2.9 से जज के मूल्यांकन कार्ड पर पोज़िशन बदलने पर सुसंगतता भी दिखती है, और जनरेट किए गए लेबल मानव चरण ख़त्म होने से पहले /judge_calibration/results पर पढ़े जा सकते हैं।

LLM-को-जज के रूप में कैलिब्रेशन सभी विकल्प सूचीबद्ध करता है। जज अलाइनमेंट किसी मौजूदा गोल्ड सेट के सामने एक जज के रूब्रिक को ट्यून करने के बारे में है।

दूसरे टूल

LangSmith, Langfuse और Galileo में से हर एक जज को मानव सुधारों के साथ संरेखित करने देता है। Langfuse एक मानव स्कोर और एक जज स्कोर के बीच Cohen का κ निकालता है, एक बार में दो शृंखलाओं के लिए। Label Studio के सशुल्क प्लान दिखाते हैं कि एनोटेटर और LLM कहाँ सहमत हैं। देखें AI एजेंट मूल्यांकन टूल की तुलना

अक्सर पूछे जाने वाले प्रश्न

LLM जज और इंसानों के बीच अच्छा kappa कितना है?

कोई तय सीमा नहीं है। जज-मानव kappa की तुलना उन्हीं आइटमों पर दो इंसानों के बीच के kappa से करें। मानव-मानव आँकड़े के क़रीब का जज लगभग उतना ही सहमत है जितना एक और एनोटेटर होता। κ और α के लिए आम मोटा नियम, भरोसे के लिए 0.8 या ज़्यादा और अस्थायी निष्कर्षों के लिए 0.67 से 0.8, पूरे कार्य का वर्णन करता है, और कठिन कार्य इस पर सीमा लगा देता है कि कोई भी जज कहाँ तक पहुँच सकता है।

क्या एनोटेटरों को LLM जज का जवाब देखना चाहिए?

जब तक आप सहमति माप रहे हैं, नहीं। जो एनोटेटर जज का फ़ैसला देख सकते हैं, वे उसी पर टिकने लगते हैं, जिससे जज की दिखने वाली सहमति बढ़ जाती है। फ़ैसला तभी दिखाएँ जब कैलिब्रेशन सैंपल लेबल हो चुका हो, अगर दिखाना ही हो।

LLM जज में पोज़िशन बायस कैसे जाँचूँ?

हर जोड़ी दो बार दिखाएँ, एक बार हर क्रम में, और गिनें कि क्रम के साथ फ़ैसला कितनी बार बदलता है। सहमति के साथ सुसंगत जोड़ियों का अनुपात रिपोर्ट करें, और जिन जोड़ियों पर फ़ैसला पलटता है उन्हें हटा दें या दोबारा चलाएँ।

LLM जज के लिए expected calibration error क्या है?

ECE जज के विश्वास और उसकी सटीकता के बीच का अंतर मापता है। फ़ैसलों को विश्वास के हिसाब से समूहों में बाँटा जाता है, और ECE हर समूह के विश्वास और उसके उन फ़ैसलों के अनुपात के बीच का औसत अंतर है जो मानव लेबल से मेल खाए, समूह के आकार से भारित। अच्छी तरह कैलिब्रेटेड जज का ECE शून्य के क़रीब होता है।

आगे पढ़ें