Skip to content

Strumenti di annotazione di documenti e PDF a confronto: open source e a pagamento

Confronta Potato, Labelbox, Label Studio, INCEpTION, Kili, Prodigy e doccano per annotare i PDF, con rendering nativo, riquadri di regione, OCR e collegamenti tra pagine.

Annotare un PDF richiede tre cose che uno strumento per il testo non offre: rendere la pagina reale, ancorare le etichette alle coordinate della pagina e collegare le annotazioni tra pagine diverse. Potato, Labelbox, INCEpTION e Kili rendono i PDF in modo nativo. Labelbox e Potato sono i due strumenti che documentano un modo per collegare annotazioni su pagine diverse. L'edizione open source di Label Studio chiede di convertire prima il PDF in immagini, e la sua etichettatura nativa dei PDF è una funzione Enterprise.

Un PDF descrive segni su pagine anziché una sequenza di caratteri, quindi annotarlo come testo estratto butta via il numero di pagina, l'ordine delle colonne e la struttura delle tabelle. Come annotare i documenti spiega perché questo conta e quali sono le alternative. Questa pagina mette a confronto gli strumenti.

Questa pagina riguarda solo i documenti. Strumenti di annotazione a confronto copre ogni tipo di dato in un'unica pagina.

Capacità a confronto

Ogni voce qui sotto è stata letta nella documentazione dello strumento stesso il 2026-09-24. Un trattino significa che la documentazione non descriveva quella capacità, il che non equivale a un rifiuto da parte dello strumento.

StrumentoRende il PDF in modo nativoRiquadri di regione sulla paginaCollegamenti tra pagineOCR integratoLicenza
PotatoSìSìSìFacoltativo, in modalità linkOpen source
LabelboxSìSìSìSì, nell'editorLivello non indicato
KiliSìSìRelazioni sì, tra pagine non indicatoSìProva gratuita, poi a pagamento
INCEpTIONSìSolo span di testoRelazioni sì, tra pagine non indicatoRichiede testo incorporatoApache 2.0
Label StudioSolo EnterpriseSì-Legge il livello di testo esistenteNucleo Apache 2.0, PDF limitato
ProdigyTramite il plugin prodigy-pdfSì-Sì, tramite TesseractA pagamento, $390 uso personale
doccano----MIT
brat----MIT
CVATLa documentazione elenca immagini, video, audio, nuvole di punti---Open source

Due colonne decidono la maggior parte dei progetti. Il rendering nativo è ciò che permette a chi annota di vedere il documento anziché una sua ricostruzione, e il collegamento tra pagine è ciò che gli permette di registrare che un'affermazione a pagina 2 poggia su una tabella a pagina 9.

Collegamenti tra pagine

Le relazioni all'interno di una pagina sono comuni. Ogni strumento qui elencato che rende i PDF sa unire due annotazioni vicine tra loro. Collegare oltre il confine di una pagina è più raro, perché richiede che l'interfaccia tenga contemporaneamente due posizioni distanti sullo schermo o in memoria.

Labelbox documenta un flusso di lavoro esplicito per farlo. Chi annota seleziona lo strumento relazione, fa clic destro sulla prima annotazione e sceglie «Seleziona inizio relazione» («Select relationship start»), scorre fino alla destinazione e sceglie «Seleziona fine relazione» («Select relationship end»). Potato prende l'altra strada e impila tutte le pagine in un unico contenitore scorrevole con view_mode: scroll, così entrambe le estremità del collegamento restano raggiungibili senza uscire dalla vista, e disegna il collegamento come un unico arco.

INCEpTION e Kili supportano entrambi le relazioni sui PDF, e nessuna delle due documentazioni dice se una relazione possa attraversare più pagine. Consideralo sconosciuto e non un no.

Dove differiscono le edizioni

Label Studio è il caso in cui l'edizione conta più dello strumento. Il suo modello open source per i documenti multipagina dice che l'annotazione «richiede che tu preelabori prima il documento convertendolo in immagini separate» («requires that you first pre-process your document by converting it into separate images»), il che fa perdere il livello di testo e con esso l'annotazione per span di testo. Il rendering nativo dei PDF e il tag OcrLabels sono documentati come funzioni Enterprise, con PDF fino a 100 pagine e un pageIndex su ogni risultato.

Il suo OCR legge un livello di testo già esistente anziché riconoscere i caratteri in un'immagine. La documentazione è esplicita su questo requisito e chiede di verificare «se puoi evidenziare il testo nel PDF con il cursore» («whether you can highlight text in the PDF using your cursor»). Una pagina scansionata richiede prima un passaggio di OCR esterno.

Prodigy raggiunge i PDF tramite il plugin separato prodigy-pdf, che fornisce pdf.image.manual per i riquadri sulle pagine rese, pdf.spans.manual per gli span sul testo estratto e pdf.ocr.correct per rivedere l'output di Tesseract. Prodigy è una licenza proprietaria a vita, a $390 per l'uso personale e $490 per postazione per le aziende, con un minimo di cinque postazioni.

doccano e brat sono strumenti per il testo. Il catalogo di importatori fornito con doccano elenca TextFile, TextLine, CSV, FastText, JSON, JSONL, Excel, CoNLL, ImageFile e AudioFile, senza alcun importatore PDF tra questi. brat salva ogni documento come file di testo UTF-8 semplice accanto a un file .ann separato, quindi le pagine non hanno alcuna rappresentazione nel suo modello dei dati. Entrambi hanno licenza MIT ed entrambi restano buone scelte per i compiti testuali per cui sono stati costruiti.

I formati multimediali documentati di CVAT sono immagini, video, audio e nuvole di punti. La sua documentazione non menziona il PDF, il che è un'affermazione sulla documentazione anziché sul codice.

Documenti scansionati

L'OCR è il punto in cui gli strumenti divergono di più in ciò che fanno al posto tuo. Labelbox e Kili riconoscono il testo dai pixel, quindi una scansione funziona senza preparazione. Kili usa il testo nativo del PDF dove esiste e altrimenti ripiega sull'immagine, e accetta OCR calcolato esternamente attraverso un campo di metadati in formato Google Vision. Label Studio e INCEpTION richiedono entrambi un livello di testo incorporato e lasciano il riconoscimento a te.

L'OCR di Potato è facoltativo e viene eseguito solo in modalità link. L'opzione ocr accetta false, true o auto, e auto esegue il passaggio solo quando il livello di testo incorporato torna vuoto, il che si adatta a un corpus che mescola file nati digitali e scansioni.

yaml
instance_display:
  fields:
    - key: pdf
      type: pdf
      label: "Document"
      display_options:
        annotation_mode: link
        view_mode: scroll
        ocr: auto
        enable_text_anchors: true
        enable_region_anchors: true
        anchor_labels:
          - name: claim
            color: "#dc2626"
          - name: figure
            color: "#2563eb"
        link_types:
          - name: refers_to
            directed: true
            allowed_source_labels: [claim]
            allowed_target_labels: [figure]

allowed_source_labels e allowed_target_labels vincolano quali ancore un tipo di collegamento può unire, così un collegamento refers_to può partire solo da un'affermazione e finire solo su una figura. Una linea guida espressa in questo modo viene imposta dall'interfaccia anziché ricordata da chi annota.

Cosa Potato non fa per i documenti

Potato non fornisce una forza lavoro di annotatori, mentre Labelbox, Kili e Scale sono costruiti attorno a servizi di etichettatura gestiti. Potato non ha un ciclo di addestramento di modelli collegato all'annotazione di documenti, che è ciò che prodigy-pdf offre attraverso il resto di Prodigy. L'OCR di Potato viene eseguito solo in modalità link, quindi un compito in modalità span su scansioni richiede che il livello di testo sia aggiunto in anticipo.

I file Word e Markdown usano la visualizzazione document di Potato, distinta dalla visualizzazione pdf. Tra gli strumenti qui presenti, gli elenchi di formati di doccano e di INCEpTION sono abbastanza espliciti da dire che DOCX è assente; gli altri non lo menzionano in un senso né nell'altro.

Letture correlate

Verificato sulla documentazione, sulla pagina dei prezzi e sul repository di ciascun progetto il 2026-09-24. Se una cella è sbagliata, segnalacelo.