Skip to content

दस्तावेज़ और PDF एनोटेशन टूल की तुलना: ओपन सोर्स और सशुल्क

PDF एनोटेट करने के लिए Potato, Labelbox, Label Studio, INCEpTION, Kili, Prodigy और doccano की तुलना, जिसमें नेटिव रेंडरिंग, क्षेत्र बॉक्स, OCR और पन्नों के आर-पार लिंक शामिल हैं।

PDF एनोटेट करने के लिए तीन चीज़ें चाहिए जो कोई टेक्स्ट टूल नहीं देता: असली पन्ने को रेंडर करना, लेबल को पन्ने के निर्देशांक से जोड़ना, और एनोटेशन को पन्नों के आर-पार लिंक करना। Potato, Labelbox, INCEpTION और Kili, PDF को नेटिव रूप से रेंडर करते हैं। Labelbox और Potato वे दो टूल हैं जो अलग-अलग पन्नों पर मौजूद एनोटेशन को जोड़ने का तरीका प्रलेखित करते हैं। Label Studio का ओपन-सोर्स संस्करण पहले PDF को छवियों में बदलने को कहता है, और उसकी नेटिव PDF लेबलिंग Enterprise की सुविधा है।

PDF वर्णों के अनुक्रम के बजाय पन्नों पर बने निशानों का वर्णन करता है, इसलिए उसे निकाले गए टेक्स्ट की तरह एनोटेट करने पर पन्ने का नंबर, स्तंभों का क्रम और तालिका की संरचना छूट जाती है। दस्तावेज़ कैसे एनोटेट करें बताता है कि यह क्यों मायने रखता है और विकल्प क्या हैं। यह पन्ना टूल की तुलना करता है।

यह पन्ना केवल दस्तावेज़ों पर है। एनोटेशन टूल की तुलना हर डेटा प्रकार को एक ही पन्ने पर समेटता है।

क्षमताएँ आमने-सामने

नीचे की हर प्रविष्टि 2026-09-24 को उस टूल के अपने प्रलेखन से पढ़ी गई। डैश का अर्थ है कि प्रलेखन ने उस क्षमता का वर्णन नहीं किया, जो टूल के उसे अस्वीकार करने के समान नहीं है।

टूलPDF को नेटिव रूप से रेंडर करता हैपन्ने पर क्षेत्र बॉक्सपन्नों के आर-पार लिंकअंतर्निहित OCRलाइसेंस
Potatoहाँहाँहाँवैकल्पिक, लिंक मोड मेंओपन सोर्स
Labelboxहाँहाँहाँहाँ, एडिटर के भीतरश्रेणी नहीं बताई गई
Kiliहाँहाँसंबंध हाँ, पन्नों के आर-पार नहीं बताया गयाहाँनिःशुल्क ट्रायल, फिर सशुल्क
INCEpTIONहाँकेवल टेक्स्ट स्पैनसंबंध हाँ, पन्नों के आर-पार नहीं बताया गयाअंतर्निहित टेक्स्ट चाहिएApache 2.0
Label Studioकेवल Enterpriseहाँ-मौजूदा टेक्स्ट परत पढ़ता हैApache 2.0 कोर, PDF सीमित
Prodigyprodigy-pdf प्लगइन के ज़रिएहाँ-हाँ, Tesseract के ज़रिएसशुल्क, व्यक्तिगत $390
doccano----MIT
brat----MIT
CVATप्रलेखन में छवियाँ, वीडियो, ऑडियो, पॉइंट क्लाउड---ओपन सोर्स

अधिकांश परियोजनाओं का फ़ैसला दो स्तंभ करते हैं। नेटिव रेंडरिंग वह है जो एनोटेटर को दस्तावेज़ की पुनर्रचना के बजाय दस्तावेज़ ही दिखाती है, और पन्नों के आर-पार लिंक वह है जिससे वह दर्ज कर पाता है कि पन्ना 2 का कोई दावा पन्ना 9 की किसी तालिका पर टिका है।

पन्नों के आर-पार लिंक

एक ही पन्ने के भीतर संबंध आम हैं। यहाँ का हर टूल जो PDF रेंडर करता है, पास-पास पड़े दो एनोटेशन जोड़ सकता है। पन्ने की सीमा के आर-पार लिंक करना दुर्लभ है, क्योंकि इसके लिए इंटरफ़ेस को दो दूरस्थ स्थानों को एक साथ स्क्रीन पर या स्मृति में रखना पड़ता है।

Labelbox इसके लिए स्पष्ट कार्यप्रवाह प्रलेखित करता है। एनोटेटर संबंध टूल चुनता है, पहले एनोटेशन पर दायाँ-क्लिक करके "संबंध का आरंभ चुनें" ("Select relationship start") चुनता है, गंतव्य तक स्क्रॉल करता है और "संबंध का अंत चुनें" ("Select relationship end") चुनता है। Potato दूसरा रास्ता लेता है और view_mode: scroll में हर पन्ने को एक ही स्क्रॉल होने वाले कंटेनर में ढेर कर देता है, ताकि लिंक के दोनों सिरे दृश्य छोड़े बिना पहुँच में रहें, और लिंक को एक ही चाप के रूप में खींचता है।

INCEpTION और Kili दोनों PDF पर संबंधों का समर्थन करते हैं, और दोनों में से किसी के प्रलेखन में यह नहीं लिखा कि कोई संबंध पन्नों में फैल सकता है या नहीं। इसे "नहीं" के बजाय अज्ञात मानें।

संस्करण कहाँ अलग होते हैं

Label Studio वह मामला है जहाँ टूल से ज़्यादा संस्करण मायने रखता है। बहु-पृष्ठ दस्तावेज़ों के लिए उसका ओपन-सोर्स टेम्पलेट कहता है कि एनोटेशन के लिए "ज़रूरी है कि आप पहले अपने दस्तावेज़ को अलग-अलग छवियों में बदलकर उसका पूर्व-संसाधन करें" ("requires that you first pre-process your document by converting it into separate images"), जिससे टेक्स्ट परत और उसके साथ टेक्स्ट-स्पैन एनोटेशन चला जाता है। नेटिव PDF रेंडरिंग और OcrLabels टैग को Enterprise सुविधाओं के रूप में प्रलेखित किया गया है, जिसमें 100 पन्नों तक की PDF और हर परिणाम पर एक pageIndex शामिल है।

उसका OCR किसी छवि में वर्ण पहचानने के बजाय पहले से मौजूद टेक्स्ट परत पढ़ता है। प्रलेखन इस शर्त पर सीधा है और जाँचने को कहता है कि "क्या आप कर्सर से PDF में टेक्स्ट हाइलाइट कर सकते हैं" ("whether you can highlight text in the PDF using your cursor")। स्कैन किए गए पन्ने के लिए पहले एक बाहरी OCR चरण चाहिए।

Prodigy, PDF तक अलग prodigy-pdf प्लगइन के ज़रिए पहुँचता है, जो रेंडर किए गए पन्नों पर बॉक्स के लिए pdf.image.manual, निकाले गए टेक्स्ट पर स्पैन के लिए pdf.spans.manual, और Tesseract के आउटपुट की समीक्षा के लिए pdf.ocr.correct देता है। Prodigy एक स्वामित्व वाला आजीवन लाइसेंस है, व्यक्तिगत उपयोग के लिए $390 और कंपनियों के लिए $490 प्रति सीट, न्यूनतम पाँच सीट के साथ।

doccano और brat टेक्स्ट टूल हैं। doccano के साथ आने वाली आयातक सूची में TextFile, TextLine, CSV, FastText, JSON, JSONL, Excel, CoNLL, ImageFile और AudioFile हैं, और उनमें कोई PDF आयातक नहीं है। brat हर दस्तावेज़ को सादे UTF-8 टेक्स्ट फ़ाइल के रूप में, एक अलग .ann फ़ाइल के साथ रखता है, इसलिए उसके डेटा मॉडल में पन्नों का कोई प्रतिनिधित्व नहीं है। दोनों MIT लाइसेंस पर हैं और दोनों उन टेक्स्ट कार्यों के लिए अच्छे विकल्प बने हुए हैं जिनके लिए वे बनाए गए थे।

CVAT के प्रलेखित मीडिया फ़ॉर्मैट छवियाँ, वीडियो, ऑडियो और पॉइंट क्लाउड हैं। उसका प्रलेखन PDF का उल्लेख नहीं करता, जो कोडबेस के बारे में नहीं, बल्कि प्रलेखन के बारे में कथन है।

स्कैन किए गए दस्तावेज़

टूल आपके लिए क्या कर देंगे, इस पर सबसे ज़्यादा फ़र्क OCR में दिखता है। Labelbox और Kili पिक्सेल से टेक्स्ट पहचानते हैं, इसलिए स्कैन बिना तैयारी के चल जाता है। Kili जहाँ PDF का नेटिव टेक्स्ट मौजूद हो वहाँ उसे इस्तेमाल करता है और बाकी जगह छवि पर लौट आता है, और Google Vision फ़ॉर्मैट में एक मेटाडेटा फ़ील्ड के ज़रिए बाहर से निकाला गया OCR स्वीकार करता है। Label Studio और INCEpTION दोनों अंतर्निहित टेक्स्ट परत माँगते हैं और पहचान का काम आप पर छोड़ते हैं।

Potato का OCR वैकल्पिक है और केवल लिंक मोड में चलता है। ocr विकल्प false, true या auto लेता है, और auto उस चरण को तभी चलाता है जब अंतर्निहित टेक्स्ट परत खाली लौटे, जो जन्म-से-डिजिटल फ़ाइलों और स्कैन को मिलाने वाले संग्रह के लिए उपयुक्त है।

yaml
instance_display:
  fields:
    - key: pdf
      type: pdf
      label: "Document"
      display_options:
        annotation_mode: link
        view_mode: scroll
        ocr: auto
        enable_text_anchors: true
        enable_region_anchors: true
        anchor_labels:
          - name: claim
            color: "#dc2626"
          - name: figure
            color: "#2563eb"
        link_types:
          - name: refers_to
            directed: true
            allowed_source_labels: [claim]
            allowed_target_labels: [figure]

allowed_source_labels और allowed_target_labels तय करते हैं कि कोई लिंक प्रकार किन एंकरों को जोड़ सकता है, ताकि refers_to लिंक केवल किसी दावे से शुरू हो और केवल किसी आकृति पर समाप्त हो। इस तरह व्यक्त किया गया दिशानिर्देश एनोटेटर की याददाश्त के बजाय इंटरफ़ेस से लागू होता है।

दस्तावेज़ों के लिए Potato क्या नहीं करता

Potato एनोटेटरों का कार्यबल नहीं देता, जबकि Labelbox, Kili और Scale प्रबंधित लेबलिंग सेवाओं के इर्द-गिर्द बने हैं। Potato में दस्तावेज़ एनोटेशन से जुड़ा कोई मॉडल-प्रशिक्षण चक्र नहीं है, जो prodigy-pdf बाक़ी Prodigy के ज़रिए देता है। Potato का OCR केवल लिंक मोड में चलता है, इसलिए स्कैन पर स्पैन-मोड कार्य के लिए टेक्स्ट परत पहले से जोड़नी होगी।

Word और Markdown फ़ाइलें pdf डिस्प्ले के बजाय Potato के अलग document डिस्प्ले का उपयोग करती हैं। यहाँ दिए टूल में doccano और INCEpTION की फ़ॉर्मैट सूचियाँ इतनी स्पष्ट हैं कि कहा जा सके कि DOCX उनमें नहीं है; बाक़ी उसका किसी भी तरह उल्लेख नहीं करते।

आगे पढ़ें

2026-09-24 को हर परियोजना के प्रलेखन, मूल्य पन्ने और रिपॉज़िटरी के विरुद्ध जाँचा गया। यदि कोई खाना ग़लत है, तो हमें बताएँ।