टेक्स्ट एनोटेशन टूल की तुलना: ओपन-सोर्स और सशुल्क NLP टूल
NER, संबंध, कोरेफ़रेंस और वर्गीकरण के लिए Potato, INCEpTION, Prodigy, Label Studio, doccano, brat और Argilla की तुलना: लाइसेंस, कीमतें और सहमति मेट्रिक।
टेक्स्ट एनोटेशन टूल एनोटेटरों को दस्तावेज़ दिखाता है और वे जो चिह्नित करते हैं उसे दर्ज करता है: पूरे टेक्स्ट के लिए एक लेबल, नामित इकाइयों जैसे हाइलाइट किए गए स्पैन, और स्पैन के बीच की कड़ियाँ। Potato, INCEpTION, doccano और Label Studio का Community Edition मुफ़्त में ख़ुद होस्ट किए जा सकते हैं, और सभी नामित इकाई पहचान तथा संबंध संभालते हैं। इनमें फ़र्क़ कोरेफ़रेंस, नॉलेज बेस से जोड़ने, और इस बात में है कि सशुल्क प्लान के बिना एनोटेटरों के बीच सहमति मापी जाती है या नहीं। Prodigy सशुल्क विकल्प है। brat और Argilla में अब नई सुविधाएँ नहीं जुड़ रहीं।
ज़्यादातर टेक्स्ट कार्य तीन में से किसी एक रूप के होते हैं। टेक्स्ट वर्गीकरण पूरे दस्तावेज़ को एक लेबल देता है। नामित इकाई पहचान और दूसरे स्पैन कार्य टेक्स्ट के हिस्सों को चिह्नित करते हैं। संबंध निष्कर्षण और कोरेफ़रेंस रिज़ॉल्यूशन स्पैन को आपस में जोड़ते हैं। इस पेज के सभी टूल स्पैन संभालते हैं, और सबसे ज़्यादा फ़र्क़ जोड़ने के काम में दिखता है।
यह पेज सिर्फ़ टेक्स्ट के बारे में है। सभी डेटा प्रकारों की एक पेज पर तुलना AI एनोटेशन टूल की तुलना में है।
किन टेक्स्ट एनोटेशन टूल की तुलना करनी चाहिए?
| टूल | लाइसेंस | कीमत | किसके लिए उपयुक्त |
|---|---|---|---|
| Potato | GPL-3.0 | मुफ़्त | ऐसे अध्ययन जिनमें हर आइटम पर कई एनोटेटर हों और सहमति रिपोर्ट करनी हो |
| INCEpTION | Apache-2.0 | मुफ़्त | नॉलेज बेस से जुड़ा भाषावैज्ञानिक एनोटेशन |
| Prodigy | प्रोप्राइटरी | $390, या $490 प्रति सीट (कम से कम पाँच सीटें) | spaCy उपयोगकर्ता जो लूप में मॉडल के साथ स्क्रिप्ट किया जा सकने वाला एनोटेशन चाहते हैं |
| Label Studio | Apache-2.0 (Community Edition) | मुफ़्त; Starter प्लान $99 प्रति माह, हर अतिरिक्त उपयोगकर्ता पर $49 | ऐसी टीमें जो टेक्स्ट के साथ इमेज, ऑडियो या वीडियो भी एनोटेट करती हैं |
| doccano | MIT | मुफ़्त | NER या वर्गीकरण प्रोजेक्ट जल्दी शुरू करना |
| brat | MIT | मुफ़्त | brat में पहले से एनोटेट कॉर्पस पढ़ना या बढ़ाना |
| Argilla | Apache-2.0 | मुफ़्त | Hugging Face इकोसिस्टम में फ़ीडबैक और पसंद डेटा |
सुविधाएँ आमने-सामने
| Potato | INCEpTION | Prodigy | Label Studio | doccano | |
|---|---|---|---|---|---|
| दस्तावेज़ वर्गीकरण | हाँ | हाँ | हाँ | हाँ | हाँ |
| स्पैन (NER) | हाँ | हाँ | हाँ | हाँ | हाँ |
| स्पैन के बीच संबंध | हाँ (span_link) | हाँ | हाँ | हाँ (Relations टैग) | हाँ, प्रोजेक्ट विकल्प के रूप में |
| सहमति मेट्रिक | हाँ, मुफ़्त | हाँ, मुफ़्त | हाँ, सशुल्क उत्पाद में | सिर्फ़ सशुल्क प्लान में | नहीं |
| मॉडल या LLM के सुझाव | 13 एंडपॉइंट प्रकार | रिकमेंडर, साथ में प्रायोगिक LLM सपोर्ट | spacy-llm | ML बैकएंड | बाहरी API से ऑटो-लेबलिंग |
| ख़ुद होस्ट करना | हाँ | हाँ | हाँ | हाँ | हाँ |
टेक्स्ट लेबल पर सहमति
एक ही इकाई को चिह्नित करने वाले दो एनोटेटर शायद ही कभी उसकी सटीक सीमाओं पर सहमत होते हैं, और जो मेट्रिक लेबल की तुलना टोकन-दर-टोकन करता है, वह सीमा के हर अंतर को लेबल पर असहमति मान लेता है। इसलिए कोई टूल स्पैन पर सहमति को कैसे आँकता है, यह उतना ही मायने रखता है जितना यह कि वह सहमति रिपोर्ट करता है या नहीं।
- Potato BIO टैग पर टोकन-स्तर का κ, सटीक और आंशिक मिलान पर स्पैन F1, यूनिटाइज़िंग रूप में Krippendorff का α, और Mathet et al. (2015) का γ रिपोर्ट करता है। आख़िरी दो यह भी आँकते हैं कि स्पैन कहाँ शुरू और ख़त्म होता है, सिर्फ़ यह नहीं कि उसे क्या नाम दिया गया। देखें स्पैन पर सहमति मापना।
- INCEpTION Cohen का κ, Fleiss का κ और Krippendorff का α निकालता है, और असहमतियाँ सुलझाने के लिए उसमें क्यूरेशन इंटरफ़ेस है।
- Prodigy Krippendorff का α और Gwet का AC2 देता है, और निर्णय के लिए
reviewरेसिपी। - Label Studio सहमति को अपने सशुल्क प्लान तक सीमित रखता है। उसके Enterprise संस्करण के लिए सूचीबद्ध मेट्रिक हैं: सटीक मिलान, संख्यात्मक अंतर, IoU और स्पैन ओवरलैप।
- doccano में कोई सहमति मेट्रिक नहीं है।
सामान्य स्थिति के लिए देखें इंटर-एनोटेटर सहमति की व्याख्या।
टूल विस्तार से
INCEpTION
TU Darmstadt का INCEpTION, WebAnno का उत्तराधिकारी है और भाषावैज्ञानिक काम के लिए सबसे नज़दीकी तुलना है। इसमें संबंध लेयर, कोरेफ़रेंस के लिए चेन लेयर, दस्तावेज़-स्तर का एनोटेशन, और ऐसे कॉन्सेप्ट फ़ीचर हैं जो किसी एनोटेशन को Wikidata या DBpedia जैसे नॉलेज बेस की किसी प्रविष्टि से जोड़ते हैं। नॉलेज बेस से जोड़ने में यह Potato से आगे है। इसके रिकमेंडर एनोटेशन सुझाते हैं, और सक्रिय शिक्षण इसमें बना हुआ है। यह एक Java ऐप्लिकेशन है और इस पेज के बाक़ी टूल से इसे डिप्लॉय करने में ज़्यादा मेहनत लगती है। सिस्टम का विवरण Eckart de Castilho et al. (EMNLP 2024) में है।
Prodigy
Explosion का Prodigy लूप में मॉडल के साथ एनोटेशन के इर्द-गिर्द बना है और spaCy से यहाँ के किसी भी दूसरे टूल से ज़्यादा क़रीब से जुड़ा है। यह वर्गीकरण, स्पैन, rel.manual रेसिपी से संबंध, और coref.manual से कोरेफ़रेंस संभालता है, और spacy-llm के ज़रिए LLM तक पहुँचता है। कार्य Python रेसिपी में परिभाषित होते हैं। इस पेज पर यही अकेला सशुल्क टूल है।
Label Studio
Label Studio का टेक्स्ट सपोर्ट एक ऐसे टूल का हिस्सा है जो इमेज, ऑडियो, वीडियो और टाइम सीरीज़ भी संभालता है। उसका Relations टैग लेबल किए गए क्षेत्रों को जोड़ता है। Community Edition मुफ़्त और ओपन-सोर्स है। सहमति, ग्राउंड ट्रुथ से जाँच और क्वालिटी डैशबोर्ड सशुल्क प्लान में हैं, जिनकी शुरुआत $99 प्रति माह वाले Starter से होती है।
doccano
टेक्स्ट के लिए doccano सबसे जल्दी सेट होता है। इसके प्रोजेक्ट प्रकार हैं: दस्तावेज़ वर्गीकरण, सीक्वेंस लेबलिंग, सीक्वेंस-टू-सीक्वेंस, इंटेंट पहचान और स्लॉट भरना, और स्पीच-टू-टेक्स्ट। सीक्वेंस लेबलिंग प्रोजेक्ट ओवरलैप होने वाले स्पैन और संबंधों की अनुमति दे सकते हैं। इसमें कोरेफ़रेंस या इवेंट एनोटेशन नहीं है, और न ही सहमति मेट्रिक।
brat
कई NLP कॉर्पस brat में बनाए गए, और उसका standoff फ़ॉर्मैट इकाइयाँ, n-ary इवेंट, बाइनरी संबंध, समतुल्यता समूह, एट्रिब्यूट और नॉर्मलाइज़ेशन समेटता है। आख़िरी रिलीज़ नवंबर 2012 की v1.3 है, और master पर आख़िरी कमिट अक्टूबर 2021 का है। इसका स्टैंडअलोन सर्वर Python का cgi मॉड्यूल इम्पोर्ट करता है, जिसे Python 3.13 में हटा दिया गया, इसलिए मौजूदा Python पर यह बिना किसी जुगाड़ के शुरू नहीं होता। brat कॉर्पस पढ़ना अब भी काम का है। brat में नया प्रोजेक्ट शुरू करना कहीं मुश्किल से उचित ठहरता है।
Argilla
Argilla भाषा मॉडल के लिए फ़ीडबैक और पसंद डेटा पर केंद्रित है और Hugging Face Datasets से जुड़ता है। यह टेक्स्ट वर्गीकरण, टोकन वर्गीकरण और जनरेट किए गए टेक्स्ट के मूल्यांकन को सपोर्ट करता है। इसकी रिपॉज़िटरी में अब लिखा है कि मूल लेखक दूसरे प्रोजेक्ट पर चले गए हैं, और प्रोजेक्ट को बग फ़िक्स और पैच मिलते रहेंगे, पर नई सुविधाएँ नहीं।
शोध प्रणालियाँ
कई एनोटेशन सिस्टम ACL सिस्टम डेमो के रूप में प्रकाशित हुए हैं। Thresh सारांश, सरलीकरण और मशीन अनुवाद जैसे बारीक टेक्स्ट-मूल्यांकन कार्य YAML में कॉन्फ़िगर करता है। GATE Teamware 2 एनोटेटर प्रशिक्षण और गुणवत्ता जाँच के साथ दस्तावेज़ वर्गीकरण संभालता है।
हर प्रोजेक्ट के दस्तावेज़ीकरण, कीमत पेज और रिपॉज़िटरी से अगस्त और सितंबर 2026 में जाँचा गया।
एक टूल से दूसरे टूल में कॉर्पस ले जाना
संस्करण 2.9 से Potato brat standoff, doccano JSONL, Prodigy की db-out फ़ाइलें और CoNLL इम्पोर्ट करता है, इसलिए इनमें से किसी में शुरू हुआ प्रोजेक्ट Potato में आगे चल सकता है। मौजूदा लेबल पूर्व-एनोटेशन के रूप में आते हैं। brat के संबंध और इवेंट इम्पोर्ट नहीं होते, बल्कि इम्पोर्ट की चेतावनियों में सूचीबद्ध होते हैं। देखें प्रोजेक्ट इम्पोर्ट करना।
दूसरी दिशा में, Potato CoNLL-2003, CoNLL-U, Hugging Face डेटासेट, JSONL, CSV और Parquet एक्सपोर्ट करता है। देखें ML के लिए एनोटेशन एक्सपोर्ट करना।
Potato में इकाई और संबंध का कार्य
annotation_schemes:
- annotation_type: span
name: entities
description: "Highlight each person, organization and location."
labels: [PERSON, ORGANIZATION, LOCATION]
- annotation_type: span_link
name: relations
description: "Link each person to the organization they work for."
span_schema: entities
link_types:
- name: WORKS_FOR
directed: true
allowed_source_labels: [PERSON]
allowed_target_labels: [ORGANIZATION]span_link entities स्कीम के स्पैन के बीच टाइप वाली कड़ियाँ खींचता है, और allowed_source_labels एनोटेटर को ग़लत तरह की इकाइयाँ जोड़ने से रोकता है। इवेंट और n-ary संबंध संबंध और इवेंट निष्कर्षण में हैं, और चेन कोरेफ़रेंस रिज़ॉल्यूशन में।
टेक्स्ट के लिए Potato क्या नहीं करता
- इसका नॉलेज बेस से जोड़ना INCEpTION से सरल है।
- यह एनोटेटरों के काम करते समय spaCy मॉडल अपडेट नहीं करता, जैसा Prodigy की रेसिपी कर सकती हैं।
- इसमें spaCy एक्सपोर्टर नहीं है। CoNLL या JSONL से कन्वर्ट करें।
- brat से इम्पोर्ट करते समय संबंध और इवेंट छोड़ दिए जाते हैं।
अक्सर पूछे जाने वाले प्रश्न
सबसे अच्छा मुफ़्त टेक्स्ट एनोटेशन टूल कौन-सा है?
एक अकेले NER या वर्गीकरण प्रोजेक्ट के लिए doccano में सबसे कम मेहनत लगती है। इकाइयों को नॉलेज बेस से जोड़ने वाले भाषावैज्ञानिक एनोटेशन के लिए INCEpTION सबसे पूरा है। ऐसे अध्ययन के लिए जिसमें हर आइटम पर कई एनोटेटर हों, क्राउडवर्कर हों और सहमति का आँकड़ा रिपोर्ट करना हो, Potato यह सब बिना सशुल्क प्लान के देता है।
क्या Prodigy का कोई ओपन-सोर्स विकल्प है?
Potato, INCEpTION और doccano मुफ़्त और ओपन-सोर्स हैं। जहाँ Prodigy Python रेसिपी इस्तेमाल करता है, वहाँ Potato YAML में कॉन्फ़िगर होता है, और यह Prodigy की db-out फ़ाइलें इम्पोर्ट करता है, इसलिए Prodigy में पहले से जुटाए गए एनोटेशन साथ आ जाते हैं।
कौन-से टेक्स्ट एनोटेशन टूल इंटर-एनोटेटर सहमति रिपोर्ट करते हैं?
Potato और INCEpTION अपने मुफ़्त संस्करणों में करते हैं, और Prodigy अपने सशुल्क उत्पाद में। Label Studio सहमति को सशुल्क प्लान तक रखता है, और doccano में यह है ही नहीं। स्पैन कार्यों के लिए देखें कि मेट्रिक सीमा की असहमतियों को ध्यान में रखता है या नहीं, जैसे Krippendorff का यूनिटाइज़िंग α और γ रखते हैं।
क्या brat का अब भी रखरखाव होता है?
नहीं। इसकी आख़िरी रिलीज़ नवंबर 2012 में v1.3 थी, और इसका स्टैंडअलोन सर्वर Python 3.13 पर बिना जुगाड़ के शुरू नहीं होता। संस्करण 2.9 से Potato brat कॉर्पस इम्पोर्ट करता है और मौजूदा इकाइयों को पूर्व-एनोटेशन के रूप में रखता है।
क्या मैं मुफ़्त टूल में कोरेफ़रेंस एनोटेट कर सकता हूँ?
हाँ। INCEpTION में कोरेफ़रेंस के लिए चेन लेयर हैं, और Potato में coreference स्कीम है जो उल्लेखों को चेन में समूहित करती है। doccano कोरेफ़रेंस सपोर्ट नहीं करता।