दस्तावेज़ और PDF एनोटेशन टूल की तुलना: ओपन सोर्स और सशुल्क
PDF एनोटेट करने के लिए Potato, Labelbox, Label Studio, INCEpTION, Kili, Prodigy और doccano की तुलना, जिसमें नेटिव रेंडरिंग, क्षेत्र बॉक्स, OCR और पन्नों के आर-पार लिंक शामिल हैं।
PDF एनोटेट करने के लिए तीन चीज़ें चाहिए जो कोई टेक्स्ट टूल नहीं देता: असली पन्ने को रेंडर करना, लेबल को पन्ने के निर्देशांक से जोड़ना, और एनोटेशन को पन्नों के आर-पार लिंक करना। Potato, Labelbox, INCEpTION और Kili, PDF को नेटिव रूप से रेंडर करते हैं। Labelbox और Potato वे दो टूल हैं जो अलग-अलग पन्नों पर मौजूद एनोटेशन को जोड़ने का तरीका प्रलेखित करते हैं। Label Studio का ओपन-सोर्स संस्करण पहले PDF को छवियों में बदलने को कहता है, और उसकी नेटिव PDF लेबलिंग Enterprise की सुविधा है।
PDF वर्णों के अनुक्रम के बजाय पन्नों पर बने निशानों का वर्णन करता है, इसलिए उसे निकाले गए टेक्स्ट की तरह एनोटेट करने पर पन्ने का नंबर, स्तंभों का क्रम और तालिका की संरचना छूट जाती है। दस्तावेज़ कैसे एनोटेट करें बताता है कि यह क्यों मायने रखता है और विकल्प क्या हैं। यह पन्ना टूल की तुलना करता है।
यह पन्ना केवल दस्तावेज़ों पर है। एनोटेशन टूल की तुलना हर डेटा प्रकार को एक ही पन्ने पर समेटता है।
क्षमताएँ आमने-सामने
नीचे की हर प्रविष्टि 2026-09-24 को उस टूल के अपने प्रलेखन से पढ़ी गई। डैश का अर्थ है कि प्रलेखन ने उस क्षमता का वर्णन नहीं किया, जो टूल के उसे अस्वीकार करने के समान नहीं है।
| टूल | PDF को नेटिव रूप से रेंडर करता है | पन्ने पर क्षेत्र बॉक्स | पन्नों के आर-पार लिंक | अंतर्निहित OCR | लाइसेंस |
|---|---|---|---|---|---|
| Potato | हाँ | हाँ | हाँ | वैकल्पिक, लिंक मोड में | ओपन सोर्स |
| Labelbox | हाँ | हाँ | हाँ | हाँ, एडिटर के भीतर | श्रेणी नहीं बताई गई |
| Kili | हाँ | हाँ | संबंध हाँ, पन्नों के आर-पार नहीं बताया गया | हाँ | निःशुल्क ट्रायल, फिर सशुल्क |
| INCEpTION | हाँ | केवल टेक्स्ट स्पैन | संबंध हाँ, पन्नों के आर-पार नहीं बताया गया | अंतर्निहित टेक्स्ट चाहिए | Apache 2.0 |
| Label Studio | केवल Enterprise | हाँ | - | मौजूदा टेक्स्ट परत पढ़ता है | Apache 2.0 कोर, PDF सीमित |
| Prodigy | prodigy-pdf प्लगइन के ज़रिए | हाँ | - | हाँ, Tesseract के ज़रिए | सशुल्क, व्यक्तिगत $390 |
| doccano | - | - | - | - | MIT |
| brat | - | - | - | - | MIT |
| CVAT | प्रलेखन में छवियाँ, वीडियो, ऑडियो, पॉइंट क्लाउड | - | - | - | ओपन सोर्स |
अधिकांश परियोजनाओं का फ़ैसला दो स्तंभ करते हैं। नेटिव रेंडरिंग वह है जो एनोटेटर को दस्तावेज़ की पुनर्रचना के बजाय दस्तावेज़ ही दिखाती है, और पन्नों के आर-पार लिंक वह है जिससे वह दर्ज कर पाता है कि पन्ना 2 का कोई दावा पन्ना 9 की किसी तालिका पर टिका है।
पन्नों के आर-पार लिंक
एक ही पन्ने के भीतर संबंध आम हैं। यहाँ का हर टूल जो PDF रेंडर करता है, पास-पास पड़े दो एनोटेशन जोड़ सकता है। पन्ने की सीमा के आर-पार लिंक करना दुर्लभ है, क्योंकि इसके लिए इंटरफ़ेस को दो दूरस्थ स्थानों को एक साथ स्क्रीन पर या स्मृति में रखना पड़ता है।
Labelbox इसके लिए स्पष्ट कार्यप्रवाह प्रलेखित करता है। एनोटेटर संबंध टूल चुनता है, पहले एनोटेशन पर दायाँ-क्लिक करके "संबंध का आरंभ चुनें" ("Select relationship start") चुनता है, गंतव्य तक स्क्रॉल करता है और "संबंध का अंत चुनें" ("Select relationship end") चुनता है। Potato दूसरा रास्ता लेता है और view_mode: scroll में हर पन्ने को एक ही स्क्रॉल होने वाले कंटेनर में ढेर कर देता है, ताकि लिंक के दोनों सिरे दृश्य छोड़े बिना पहुँच में रहें, और लिंक को एक ही चाप के रूप में खींचता है।
INCEpTION और Kili दोनों PDF पर संबंधों का समर्थन करते हैं, और दोनों में से किसी के प्रलेखन में यह नहीं लिखा कि कोई संबंध पन्नों में फैल सकता है या नहीं। इसे "नहीं" के बजाय अज्ञात मानें।
संस्करण कहाँ अलग होते हैं
Label Studio वह मामला है जहाँ टूल से ज़्यादा संस्करण मायने रखता है। बहु-पृष्ठ दस्तावेज़ों के लिए उसका ओपन-सोर्स टेम्पलेट कहता है कि एनोटेशन के लिए "ज़रूरी है कि आप पहले अपने दस्तावेज़ को अलग-अलग छवियों में बदलकर उसका पूर्व-संसाधन करें" ("requires that you first pre-process your document by converting it into separate images"), जिससे टेक्स्ट परत और उसके साथ टेक्स्ट-स्पैन एनोटेशन चला जाता है। नेटिव PDF रेंडरिंग और OcrLabels टैग को Enterprise सुविधाओं के रूप में प्रलेखित किया गया है, जिसमें 100 पन्नों तक की PDF और हर परिणाम पर एक pageIndex शामिल है।
उसका OCR किसी छवि में वर्ण पहचानने के बजाय पहले से मौजूद टेक्स्ट परत पढ़ता है। प्रलेखन इस शर्त पर सीधा है और जाँचने को कहता है कि "क्या आप कर्सर से PDF में टेक्स्ट हाइलाइट कर सकते हैं" ("whether you can highlight text in the PDF using your cursor")। स्कैन किए गए पन्ने के लिए पहले एक बाहरी OCR चरण चाहिए।
Prodigy, PDF तक अलग prodigy-pdf प्लगइन के ज़रिए पहुँचता है, जो रेंडर किए गए पन्नों पर बॉक्स के लिए pdf.image.manual, निकाले गए टेक्स्ट पर स्पैन के लिए pdf.spans.manual, और Tesseract के आउटपुट की समीक्षा के लिए pdf.ocr.correct देता है। Prodigy एक स्वामित्व वाला आजीवन लाइसेंस है, व्यक्तिगत उपयोग के लिए $390 और कंपनियों के लिए $490 प्रति सीट, न्यूनतम पाँच सीट के साथ।
doccano और brat टेक्स्ट टूल हैं। doccano के साथ आने वाली आयातक सूची में TextFile, TextLine, CSV, FastText, JSON, JSONL, Excel, CoNLL, ImageFile और AudioFile हैं, और उनमें कोई PDF आयातक नहीं है। brat हर दस्तावेज़ को सादे UTF-8 टेक्स्ट फ़ाइल के रूप में, एक अलग .ann फ़ाइल के साथ रखता है, इसलिए उसके डेटा मॉडल में पन्नों का कोई प्रतिनिधित्व नहीं है। दोनों MIT लाइसेंस पर हैं और दोनों उन टेक्स्ट कार्यों के लिए अच्छे विकल्प बने हुए हैं जिनके लिए वे बनाए गए थे।
CVAT के प्रलेखित मीडिया फ़ॉर्मैट छवियाँ, वीडियो, ऑडियो और पॉइंट क्लाउड हैं। उसका प्रलेखन PDF का उल्लेख नहीं करता, जो कोडबेस के बारे में नहीं, बल्कि प्रलेखन के बारे में कथन है।
स्कैन किए गए दस्तावेज़
टूल आपके लिए क्या कर देंगे, इस पर सबसे ज़्यादा फ़र्क OCR में दिखता है। Labelbox और Kili पिक्सेल से टेक्स्ट पहचानते हैं, इसलिए स्कैन बिना तैयारी के चल जाता है। Kili जहाँ PDF का नेटिव टेक्स्ट मौजूद हो वहाँ उसे इस्तेमाल करता है और बाकी जगह छवि पर लौट आता है, और Google Vision फ़ॉर्मैट में एक मेटाडेटा फ़ील्ड के ज़रिए बाहर से निकाला गया OCR स्वीकार करता है। Label Studio और INCEpTION दोनों अंतर्निहित टेक्स्ट परत माँगते हैं और पहचान का काम आप पर छोड़ते हैं।
Potato का OCR वैकल्पिक है और केवल लिंक मोड में चलता है। ocr विकल्प false, true या auto लेता है, और auto उस चरण को तभी चलाता है जब अंतर्निहित टेक्स्ट परत खाली लौटे, जो जन्म-से-डिजिटल फ़ाइलों और स्कैन को मिलाने वाले संग्रह के लिए उपयुक्त है।
instance_display:
fields:
- key: pdf
type: pdf
label: "Document"
display_options:
annotation_mode: link
view_mode: scroll
ocr: auto
enable_text_anchors: true
enable_region_anchors: true
anchor_labels:
- name: claim
color: "#dc2626"
- name: figure
color: "#2563eb"
link_types:
- name: refers_to
directed: true
allowed_source_labels: [claim]
allowed_target_labels: [figure]allowed_source_labels और allowed_target_labels तय करते हैं कि कोई लिंक प्रकार किन एंकरों को जोड़ सकता है, ताकि refers_to लिंक केवल किसी दावे से शुरू हो और केवल किसी आकृति पर समाप्त हो। इस तरह व्यक्त किया गया दिशानिर्देश एनोटेटर की याददाश्त के बजाय इंटरफ़ेस से लागू होता है।
दस्तावेज़ों के लिए Potato क्या नहीं करता
Potato एनोटेटरों का कार्यबल नहीं देता, जबकि Labelbox, Kili और Scale प्रबंधित लेबलिंग सेवाओं के इर्द-गिर्द बने हैं। Potato में दस्तावेज़ एनोटेशन से जुड़ा कोई मॉडल-प्रशिक्षण चक्र नहीं है, जो prodigy-pdf बाक़ी Prodigy के ज़रिए देता है। Potato का OCR केवल लिंक मोड में चलता है, इसलिए स्कैन पर स्पैन-मोड कार्य के लिए टेक्स्ट परत पहले से जोड़नी होगी।
Word और Markdown फ़ाइलें pdf डिस्प्ले के बजाय Potato के अलग document डिस्प्ले का उपयोग करती हैं। यहाँ दिए टूल में doccano और INCEpTION की फ़ॉर्मैट सूचियाँ इतनी स्पष्ट हैं कि कहा जा सके कि DOCX उनमें नहीं है; बाक़ी उसका किसी भी तरह उल्लेख नहीं करते।
आगे पढ़ें
- दस्तावेज़ और PDF कैसे एनोटेट करें एंकर, स्कैन और लेआउट क्या ढोता है, इन्हें समेटता है।
- PDF एनोटेशन उन सभी विकल्पों को प्रलेखित करता है जो
pdfडिस्प्ले लेता है। - एनोटेशन टूल की तुलना हर डेटा प्रकार को एक ही पन्ने पर समेटता है।
- टेक्स्ट एनोटेशन टूल की तुलना NER, संबंध और वर्गीकरण को समेटता है।
2026-09-24 को हर परियोजना के प्रलेखन, मूल्य पन्ने और रिपॉज़िटरी के विरुद्ध जाँचा गया। यदि कोई खाना ग़लत है, तो हमें बताएँ।