Skip to content

Span एनोटेशन

Span एनोटेशन की पूरी मार्गदर्शिका: टेक्स्ट के हिस्सों को चिह्नित करना, ओवरलैपिंग और नेस्टेड span, लेबल के रंग, BIO/IOB टैगिंग, और Potato में span कार्य बनाना।

Span एनोटेशन का मतलब है पूरे आइटम को लेबल करने के बजाय उसके भीतर किसी हिस्से को चिह्नित करना। एनोटेटर टेक्स्ट का एक टुकड़ा (या ऑडियो का एक खंड) चुनता है और उसे लेबल देता है। named entity recognition, गलतियाँ चिह्नित करना, extractive question answering और ऑडियो घटना पहचान, सबकी नींव यही है, ये सब अलग-अलग लेबल-समूह वाले span कार्य हैं।

Span एक लेबल किया हुआ उप-अनुक्रम है: एक शुरुआती स्थिति, एक अंतिम स्थिति, और एक श्रेणी। मशीन लर्निंग में इसे आम तौर पर sequence labeling की तरह गढ़ा जाता है, जहाँ हर token को एक टैग मिलता है।

एक बुनियादी span कार्य

लेबल तय कीजिए और एनोटेटरों को चिह्नित करने दीजिए। रंग और tooltip इंटरफ़ेस को तेज़ और अपने-आप समझ आने लायक बनाते हैं:

yaml
annotation_schemes:
  - annotation_type: span
    name: entities
    description: "Highlight each named entity and choose its type."
    labels: [PERSON, ORGANIZATION, LOCATION, DATE, MISC]
    sequential_key_binding: true
    allow_discontinuous: false

named entity recognition डिज़ाइन ठीक यही कार्य है, चलाने के लिए तैयार।

ओवरलैपिंग और नेस्टेड span

डिफ़ॉल्ट रूप से एक character ज़्यादा से ज़्यादा एक ही span का हिस्सा होता है। कुछ कार्यों को इससे ज़्यादा चाहिए:

  • ओवरलैपिंग span: दो एनोटेशन कुछ हिस्सा साझा करते हैं, जैसे किसी entity span के ऊपर एक sentiment span।
  • नेस्टेड span: एक span दूसरे के भीतर बैठता है, जैसे “[University of [Michigan]]”, जहाँ स्थान संगठन के अंदर है।

जब आपके दिशानिर्देश ऐसा माँगें तो allow_overlapping: true रखें। यह फ़ैसला जल्दी कर लें, क्योंकि इससे बदल जाता है कि एनोटेटर सीमाओं को किस तरह देखते हैं।

BIO/IOB टैगिंग, आपका एक्सपोर्ट कैसा दिखता है

ट्रेनिंग के लिए span एनोटेशन आम तौर पर BIO स्कीम (IOB भी कहते हैं) में token टैग के रूप में एक्सपोर्ट होते हैं: B- entity के पहले token पर लगता है, I- उसके भीतर के token पर, और O उन token पर जो किसी entity में नहीं हैं।

text
Barack    B-PERSON
Obama     I-PERSON
visited   O
Paris     B-LOCATION

Potato span को CoNLL और spaCy फ़ॉर्मैट में एक्सपोर्ट कर सकता है, जो सीधे इसी टैगिंग का इस्तेमाल करते हैं। देखें ML के लिए एनोटेशन एक्सपोर्ट करना

सीमाएँ ठीक तय करना

Span कार्य का सबसे कठिन हिस्सा यही तय करना है कि span कहाँ शुरू होता है और कहाँ ख़त्म। कुछ नियम मदद करते हैं:

  • तय कीजिए कि आसपास के विराम चिह्न, उपाधियाँ (“Dr.”) और अंत में लगे possessive शामिल होंगे या नहीं, और इसे लिख लीजिए।
  • सहमति सिर्फ़ दस्तावेज़ के स्तर पर नहीं, span के स्तर पर मापिए, तभी सीमाओं की असहमति सामने आती है। देखें अंतर-एनोटेटर सहमति
  • Tooltip के ज़रिए सीमा का नियम एनोटेटर की आँखों के सामने बनाए रखें।

NER से आगे के span कार्य

यही तंत्र कई कार्यों को चलाता है:

आगे पढ़ें