Span एनोटेशन
Span एनोटेशन की पूरी मार्गदर्शिका: टेक्स्ट के हिस्सों को चिह्नित करना, ओवरलैपिंग और नेस्टेड span, लेबल के रंग, BIO/IOB टैगिंग, और Potato में span कार्य बनाना।
Span एनोटेशन का मतलब है पूरे आइटम को लेबल करने के बजाय उसके भीतर किसी हिस्से को चिह्नित करना। एनोटेटर टेक्स्ट का एक टुकड़ा (या ऑडियो का एक खंड) चुनता है और उसे लेबल देता है। named entity recognition, गलतियाँ चिह्नित करना, extractive question answering और ऑडियो घटना पहचान, सबकी नींव यही है, ये सब अलग-अलग लेबल-समूह वाले span कार्य हैं।
Span एक लेबल किया हुआ उप-अनुक्रम है: एक शुरुआती स्थिति, एक अंतिम स्थिति, और एक श्रेणी। मशीन लर्निंग में इसे आम तौर पर sequence labeling की तरह गढ़ा जाता है, जहाँ हर token को एक टैग मिलता है।
एक बुनियादी span कार्य
लेबल तय कीजिए और एनोटेटरों को चिह्नित करने दीजिए। रंग और tooltip इंटरफ़ेस को तेज़ और अपने-आप समझ आने लायक बनाते हैं:
annotation_schemes:
- annotation_type: span
name: entities
description: "Highlight each named entity and choose its type."
labels: [PERSON, ORGANIZATION, LOCATION, DATE, MISC]
sequential_key_binding: true
allow_discontinuous: falsenamed entity recognition डिज़ाइन ठीक यही कार्य है, चलाने के लिए तैयार।
ओवरलैपिंग और नेस्टेड span
डिफ़ॉल्ट रूप से एक character ज़्यादा से ज़्यादा एक ही span का हिस्सा होता है। कुछ कार्यों को इससे ज़्यादा चाहिए:
- ओवरलैपिंग span: दो एनोटेशन कुछ हिस्सा साझा करते हैं, जैसे किसी entity span के ऊपर एक sentiment span।
- नेस्टेड span: एक span दूसरे के भीतर बैठता है, जैसे “[University of [Michigan]]”, जहाँ स्थान संगठन के अंदर है।
जब आपके दिशानिर्देश ऐसा माँगें तो allow_overlapping: true रखें। यह फ़ैसला जल्दी कर लें, क्योंकि इससे बदल जाता है कि एनोटेटर सीमाओं को किस तरह देखते हैं।
BIO/IOB टैगिंग, आपका एक्सपोर्ट कैसा दिखता है
ट्रेनिंग के लिए span एनोटेशन आम तौर पर BIO स्कीम (IOB भी कहते हैं) में token टैग के रूप में एक्सपोर्ट होते हैं: B- entity के पहले token पर लगता है, I- उसके भीतर के token पर, और O उन token पर जो किसी entity में नहीं हैं।
Barack B-PERSON
Obama I-PERSON
visited O
Paris B-LOCATION
Potato span को CoNLL और spaCy फ़ॉर्मैट में एक्सपोर्ट कर सकता है, जो सीधे इसी टैगिंग का इस्तेमाल करते हैं। देखें ML के लिए एनोटेशन एक्सपोर्ट करना।
सीमाएँ ठीक तय करना
Span कार्य का सबसे कठिन हिस्सा यही तय करना है कि span कहाँ शुरू होता है और कहाँ ख़त्म। कुछ नियम मदद करते हैं:
- तय कीजिए कि आसपास के विराम चिह्न, उपाधियाँ (“Dr.”) और अंत में लगे possessive शामिल होंगे या नहीं, और इसे लिख लीजिए।
- सहमति सिर्फ़ दस्तावेज़ के स्तर पर नहीं, span के स्तर पर मापिए, तभी सीमाओं की असहमति सामने आती है। देखें अंतर-एनोटेटर सहमति।
- Tooltip के ज़रिए सीमा का नियम एनोटेटर की आँखों के सामने बनाए रखें।
NER से आगे के span कार्य
यही तंत्र कई कार्यों को चलाता है:
- गलती के span: किसी अनुवाद या मॉडल आउटपुट में गलतियाँ चिह्नित करें, MQM शैली में। देखें Hallucination पकड़ना।
- Extractive QA: किसी अनुच्छेद में सवाल का जवाब चिह्नित करें।
- ऑडियो घटना पहचान: waveform पर चिह्नित करें कि कोई ध्वनि कब आती है। देखें ऑडियो एनोटेशन।
- संबंध और coreference: span को आपस में जोड़ें। देखें संबंध और घटना निष्कर्षण और Coreference Resolution एनोटेशन।