Skip to content

टेक्स्ट एनोटेशन टूल की तुलना: ओपन-सोर्स और सशुल्क NLP टूल

NER, संबंध, कोरेफ़रेंस और वर्गीकरण के लिए Potato, INCEpTION, Prodigy, Label Studio, doccano, brat और Argilla की तुलना: लाइसेंस, कीमतें और सहमति मेट्रिक।

टेक्स्ट एनोटेशन टूल एनोटेटरों को दस्तावेज़ दिखाता है और वे जो चिह्नित करते हैं उसे दर्ज करता है: पूरे टेक्स्ट के लिए एक लेबल, नामित इकाइयों जैसे हाइलाइट किए गए स्पैन, और स्पैन के बीच की कड़ियाँ। Potato, INCEpTION, doccano और Label Studio का Community Edition मुफ़्त में ख़ुद होस्ट किए जा सकते हैं, और सभी नामित इकाई पहचान तथा संबंध संभालते हैं। इनमें फ़र्क़ कोरेफ़रेंस, नॉलेज बेस से जोड़ने, और इस बात में है कि सशुल्क प्लान के बिना एनोटेटरों के बीच सहमति मापी जाती है या नहीं। Prodigy सशुल्क विकल्प है। brat और Argilla में अब नई सुविधाएँ नहीं जुड़ रहीं।

ज़्यादातर टेक्स्ट कार्य तीन में से किसी एक रूप के होते हैं। टेक्स्ट वर्गीकरण पूरे दस्तावेज़ को एक लेबल देता है। नामित इकाई पहचान और दूसरे स्पैन कार्य टेक्स्ट के हिस्सों को चिह्नित करते हैं। संबंध निष्कर्षण और कोरेफ़रेंस रिज़ॉल्यूशन स्पैन को आपस में जोड़ते हैं। इस पेज के सभी टूल स्पैन संभालते हैं, और सबसे ज़्यादा फ़र्क़ जोड़ने के काम में दिखता है।

यह पेज सिर्फ़ टेक्स्ट के बारे में है। सभी डेटा प्रकारों की एक पेज पर तुलना AI एनोटेशन टूल की तुलना में है।

किन टेक्स्ट एनोटेशन टूल की तुलना करनी चाहिए?

टूललाइसेंसकीमतकिसके लिए उपयुक्त
PotatoGPL-3.0मुफ़्तऐसे अध्ययन जिनमें हर आइटम पर कई एनोटेटर हों और सहमति रिपोर्ट करनी हो
INCEpTIONApache-2.0मुफ़्तनॉलेज बेस से जुड़ा भाषावैज्ञानिक एनोटेशन
Prodigyप्रोप्राइटरी$390, या $490 प्रति सीट (कम से कम पाँच सीटें)spaCy उपयोगकर्ता जो लूप में मॉडल के साथ स्क्रिप्ट किया जा सकने वाला एनोटेशन चाहते हैं
Label StudioApache-2.0 (Community Edition)मुफ़्त; Starter प्लान $99 प्रति माह, हर अतिरिक्त उपयोगकर्ता पर $49ऐसी टीमें जो टेक्स्ट के साथ इमेज, ऑडियो या वीडियो भी एनोटेट करती हैं
doccanoMITमुफ़्तNER या वर्गीकरण प्रोजेक्ट जल्दी शुरू करना
bratMITमुफ़्तbrat में पहले से एनोटेट कॉर्पस पढ़ना या बढ़ाना
ArgillaApache-2.0मुफ़्तHugging Face इकोसिस्टम में फ़ीडबैक और पसंद डेटा

सुविधाएँ आमने-सामने

PotatoINCEpTIONProdigyLabel Studiodoccano
दस्तावेज़ वर्गीकरणहाँहाँहाँहाँहाँ
स्पैन (NER)हाँहाँहाँहाँहाँ
स्पैन के बीच संबंधहाँ (span_link)हाँहाँहाँ (Relations टैग)हाँ, प्रोजेक्ट विकल्प के रूप में
सहमति मेट्रिकहाँ, मुफ़्तहाँ, मुफ़्तहाँ, सशुल्क उत्पाद मेंसिर्फ़ सशुल्क प्लान मेंनहीं
मॉडल या LLM के सुझाव13 एंडपॉइंट प्रकाररिकमेंडर, साथ में प्रायोगिक LLM सपोर्टspacy-llmML बैकएंडबाहरी API से ऑटो-लेबलिंग
ख़ुद होस्ट करनाहाँहाँहाँहाँहाँ

टेक्स्ट लेबल पर सहमति

एक ही इकाई को चिह्नित करने वाले दो एनोटेटर शायद ही कभी उसकी सटीक सीमाओं पर सहमत होते हैं, और जो मेट्रिक लेबल की तुलना टोकन-दर-टोकन करता है, वह सीमा के हर अंतर को लेबल पर असहमति मान लेता है। इसलिए कोई टूल स्पैन पर सहमति को कैसे आँकता है, यह उतना ही मायने रखता है जितना यह कि वह सहमति रिपोर्ट करता है या नहीं।

  • Potato BIO टैग पर टोकन-स्तर का κ, सटीक और आंशिक मिलान पर स्पैन F1, यूनिटाइज़िंग रूप में Krippendorff का α, और Mathet et al. (2015) का γ रिपोर्ट करता है। आख़िरी दो यह भी आँकते हैं कि स्पैन कहाँ शुरू और ख़त्म होता है, सिर्फ़ यह नहीं कि उसे क्या नाम दिया गया। देखें स्पैन पर सहमति मापना
  • INCEpTION Cohen का κ, Fleiss का κ और Krippendorff का α निकालता है, और असहमतियाँ सुलझाने के लिए उसमें क्यूरेशन इंटरफ़ेस है।
  • Prodigy Krippendorff का α और Gwet का AC2 देता है, और निर्णय के लिए review रेसिपी।
  • Label Studio सहमति को अपने सशुल्क प्लान तक सीमित रखता है। उसके Enterprise संस्करण के लिए सूचीबद्ध मेट्रिक हैं: सटीक मिलान, संख्यात्मक अंतर, IoU और स्पैन ओवरलैप।
  • doccano में कोई सहमति मेट्रिक नहीं है।

सामान्य स्थिति के लिए देखें इंटर-एनोटेटर सहमति की व्याख्या

टूल विस्तार से

INCEpTION

TU Darmstadt का INCEpTION, WebAnno का उत्तराधिकारी है और भाषावैज्ञानिक काम के लिए सबसे नज़दीकी तुलना है। इसमें संबंध लेयर, कोरेफ़रेंस के लिए चेन लेयर, दस्तावेज़-स्तर का एनोटेशन, और ऐसे कॉन्सेप्ट फ़ीचर हैं जो किसी एनोटेशन को Wikidata या DBpedia जैसे नॉलेज बेस की किसी प्रविष्टि से जोड़ते हैं। नॉलेज बेस से जोड़ने में यह Potato से आगे है। इसके रिकमेंडर एनोटेशन सुझाते हैं, और सक्रिय शिक्षण इसमें बना हुआ है। यह एक Java ऐप्लिकेशन है और इस पेज के बाक़ी टूल से इसे डिप्लॉय करने में ज़्यादा मेहनत लगती है। सिस्टम का विवरण Eckart de Castilho et al. (EMNLP 2024) में है।

Prodigy

Explosion का Prodigy लूप में मॉडल के साथ एनोटेशन के इर्द-गिर्द बना है और spaCy से यहाँ के किसी भी दूसरे टूल से ज़्यादा क़रीब से जुड़ा है। यह वर्गीकरण, स्पैन, rel.manual रेसिपी से संबंध, और coref.manual से कोरेफ़रेंस संभालता है, और spacy-llm के ज़रिए LLM तक पहुँचता है। कार्य Python रेसिपी में परिभाषित होते हैं। इस पेज पर यही अकेला सशुल्क टूल है।

Label Studio

Label Studio का टेक्स्ट सपोर्ट एक ऐसे टूल का हिस्सा है जो इमेज, ऑडियो, वीडियो और टाइम सीरीज़ भी संभालता है। उसका Relations टैग लेबल किए गए क्षेत्रों को जोड़ता है। Community Edition मुफ़्त और ओपन-सोर्स है। सहमति, ग्राउंड ट्रुथ से जाँच और क्वालिटी डैशबोर्ड सशुल्क प्लान में हैं, जिनकी शुरुआत $99 प्रति माह वाले Starter से होती है।

doccano

टेक्स्ट के लिए doccano सबसे जल्दी सेट होता है। इसके प्रोजेक्ट प्रकार हैं: दस्तावेज़ वर्गीकरण, सीक्वेंस लेबलिंग, सीक्वेंस-टू-सीक्वेंस, इंटेंट पहचान और स्लॉट भरना, और स्पीच-टू-टेक्स्ट। सीक्वेंस लेबलिंग प्रोजेक्ट ओवरलैप होने वाले स्पैन और संबंधों की अनुमति दे सकते हैं। इसमें कोरेफ़रेंस या इवेंट एनोटेशन नहीं है, और न ही सहमति मेट्रिक।

brat

कई NLP कॉर्पस brat में बनाए गए, और उसका standoff फ़ॉर्मैट इकाइयाँ, n-ary इवेंट, बाइनरी संबंध, समतुल्यता समूह, एट्रिब्यूट और नॉर्मलाइज़ेशन समेटता है। आख़िरी रिलीज़ नवंबर 2012 की v1.3 है, और master पर आख़िरी कमिट अक्टूबर 2021 का है। इसका स्टैंडअलोन सर्वर Python का cgi मॉड्यूल इम्पोर्ट करता है, जिसे Python 3.13 में हटा दिया गया, इसलिए मौजूदा Python पर यह बिना किसी जुगाड़ के शुरू नहीं होता। brat कॉर्पस पढ़ना अब भी काम का है। brat में नया प्रोजेक्ट शुरू करना कहीं मुश्किल से उचित ठहरता है।

Argilla

Argilla भाषा मॉडल के लिए फ़ीडबैक और पसंद डेटा पर केंद्रित है और Hugging Face Datasets से जुड़ता है। यह टेक्स्ट वर्गीकरण, टोकन वर्गीकरण और जनरेट किए गए टेक्स्ट के मूल्यांकन को सपोर्ट करता है। इसकी रिपॉज़िटरी में अब लिखा है कि मूल लेखक दूसरे प्रोजेक्ट पर चले गए हैं, और प्रोजेक्ट को बग फ़िक्स और पैच मिलते रहेंगे, पर नई सुविधाएँ नहीं।

शोध प्रणालियाँ

कई एनोटेशन सिस्टम ACL सिस्टम डेमो के रूप में प्रकाशित हुए हैं। Thresh सारांश, सरलीकरण और मशीन अनुवाद जैसे बारीक टेक्स्ट-मूल्यांकन कार्य YAML में कॉन्फ़िगर करता है। GATE Teamware 2 एनोटेटर प्रशिक्षण और गुणवत्ता जाँच के साथ दस्तावेज़ वर्गीकरण संभालता है।

हर प्रोजेक्ट के दस्तावेज़ीकरण, कीमत पेज और रिपॉज़िटरी से अगस्त और सितंबर 2026 में जाँचा गया।

एक टूल से दूसरे टूल में कॉर्पस ले जाना

संस्करण 2.9 से Potato brat standoff, doccano JSONL, Prodigy की db-out फ़ाइलें और CoNLL इम्पोर्ट करता है, इसलिए इनमें से किसी में शुरू हुआ प्रोजेक्ट Potato में आगे चल सकता है। मौजूदा लेबल पूर्व-एनोटेशन के रूप में आते हैं। brat के संबंध और इवेंट इम्पोर्ट नहीं होते, बल्कि इम्पोर्ट की चेतावनियों में सूचीबद्ध होते हैं। देखें प्रोजेक्ट इम्पोर्ट करना

दूसरी दिशा में, Potato CoNLL-2003, CoNLL-U, Hugging Face डेटासेट, JSONL, CSV और Parquet एक्सपोर्ट करता है। देखें ML के लिए एनोटेशन एक्सपोर्ट करना

Potato में इकाई और संबंध का कार्य

yaml
annotation_schemes:
  - annotation_type: span
    name: entities
    description: "Highlight each person, organization and location."
    labels: [PERSON, ORGANIZATION, LOCATION]
  - annotation_type: span_link
    name: relations
    description: "Link each person to the organization they work for."
    span_schema: entities
    link_types:
      - name: WORKS_FOR
        directed: true
        allowed_source_labels: [PERSON]
        allowed_target_labels: [ORGANIZATION]

span_link entities स्कीम के स्पैन के बीच टाइप वाली कड़ियाँ खींचता है, और allowed_source_labels एनोटेटर को ग़लत तरह की इकाइयाँ जोड़ने से रोकता है। इवेंट और n-ary संबंध संबंध और इवेंट निष्कर्षण में हैं, और चेन कोरेफ़रेंस रिज़ॉल्यूशन में।

टेक्स्ट के लिए Potato क्या नहीं करता

  • इसका नॉलेज बेस से जोड़ना INCEpTION से सरल है।
  • यह एनोटेटरों के काम करते समय spaCy मॉडल अपडेट नहीं करता, जैसा Prodigy की रेसिपी कर सकती हैं।
  • इसमें spaCy एक्सपोर्टर नहीं है। CoNLL या JSONL से कन्वर्ट करें।
  • brat से इम्पोर्ट करते समय संबंध और इवेंट छोड़ दिए जाते हैं।

अक्सर पूछे जाने वाले प्रश्न

सबसे अच्छा मुफ़्त टेक्स्ट एनोटेशन टूल कौन-सा है?

एक अकेले NER या वर्गीकरण प्रोजेक्ट के लिए doccano में सबसे कम मेहनत लगती है। इकाइयों को नॉलेज बेस से जोड़ने वाले भाषावैज्ञानिक एनोटेशन के लिए INCEpTION सबसे पूरा है। ऐसे अध्ययन के लिए जिसमें हर आइटम पर कई एनोटेटर हों, क्राउडवर्कर हों और सहमति का आँकड़ा रिपोर्ट करना हो, Potato यह सब बिना सशुल्क प्लान के देता है।

क्या Prodigy का कोई ओपन-सोर्स विकल्प है?

Potato, INCEpTION और doccano मुफ़्त और ओपन-सोर्स हैं। जहाँ Prodigy Python रेसिपी इस्तेमाल करता है, वहाँ Potato YAML में कॉन्फ़िगर होता है, और यह Prodigy की db-out फ़ाइलें इम्पोर्ट करता है, इसलिए Prodigy में पहले से जुटाए गए एनोटेशन साथ आ जाते हैं।

कौन-से टेक्स्ट एनोटेशन टूल इंटर-एनोटेटर सहमति रिपोर्ट करते हैं?

Potato और INCEpTION अपने मुफ़्त संस्करणों में करते हैं, और Prodigy अपने सशुल्क उत्पाद में। Label Studio सहमति को सशुल्क प्लान तक रखता है, और doccano में यह है ही नहीं। स्पैन कार्यों के लिए देखें कि मेट्रिक सीमा की असहमतियों को ध्यान में रखता है या नहीं, जैसे Krippendorff का यूनिटाइज़िंग α और γ रखते हैं।

क्या brat का अब भी रखरखाव होता है?

नहीं। इसकी आख़िरी रिलीज़ नवंबर 2012 में v1.3 थी, और इसका स्टैंडअलोन सर्वर Python 3.13 पर बिना जुगाड़ के शुरू नहीं होता। संस्करण 2.9 से Potato brat कॉर्पस इम्पोर्ट करता है और मौजूदा इकाइयों को पूर्व-एनोटेशन के रूप में रखता है।

क्या मैं मुफ़्त टूल में कोरेफ़रेंस एनोटेट कर सकता हूँ?

हाँ। INCEpTION में कोरेफ़रेंस के लिए चेन लेयर हैं, और Potato में coreference स्कीम है जो उल्लेखों को चेन में समूहित करती है। doccano कोरेफ़रेंस सपोर्ट नहीं करता।

आगे पढ़ें