Outils d'annotation de documents et de PDF comparés : open source et payants
Compare Potato, Labelbox, Label Studio, INCEpTION, Kili, Prodigy et doccano pour l'annotation de PDF : rendu natif, boîtes de région, OCR et liens entre pages.
Annoter un PDF demande trois choses qu'un outil de texte ne fournit pas : afficher la page réelle, ancrer les étiquettes à des coordonnées de page et relier des annotations d'une page à l'autre. Potato, Labelbox, INCEpTION et Kili affichent les PDF nativement. Labelbox et Potato sont les deux outils qui documentent un moyen de relier des annotations situées sur des pages différentes. L'édition open source de Label Studio demande de convertir d'abord le PDF en images, et son étiquetage natif de PDF est une fonctionnalité Enterprise.
Un PDF décrit des marques sur des pages plutôt qu'une suite de caractères, si bien que l'annoter sous forme de texte extrait jette le numéro de page, l'ordre des colonnes et la structure des tableaux. Comment annoter des documents explique pourquoi cela compte et quelles sont les solutions de rechange. Cette page compare les outils.
Cette page ne traite que des documents. Outils d'annotation comparés couvre tous les types de données sur une seule page.
Capacités côte à côte
Chaque entrée ci-dessous a été lue dans la documentation de l'outil lui-même le 2026-09-24. Un tiret signifie que la documentation ne décrivait pas la capacité, ce qui n'équivaut pas à un refus de l'outil.
| Outil | Affiche le PDF nativement | Boîtes de région sur la page | Liens entre pages | OCR intégré | Licence |
|---|---|---|---|---|---|
| Potato | Oui | Oui | Oui | Optionnel, en mode lien | Open source |
| Labelbox | Oui | Oui | Oui | Oui, dans l'éditeur | Niveau non précisé |
| Kili | Oui | Oui | Relations oui, entre pages non précisé | Oui | Essai gratuit, puis payant |
| INCEpTION | Oui | Empans de texte uniquement | Relations oui, entre pages non précisé | Exige du texte incorporé | Apache 2.0 |
| Label Studio | Enterprise uniquement | Oui | - | Lit la couche de texte existante | Cœur Apache 2.0, PDF restreint |
| Prodigy | Via le greffon prodigy-pdf | Oui | - | Oui, via Tesseract | Payant, $390 usage personnel |
| doccano | - | - | - | - | MIT |
| brat | - | - | - | - | MIT |
| CVAT | La doc liste images, vidéo, audio, nuages de points | - | - | - | Open source |
Deux colonnes tranchent la plupart des projets. Le rendu natif est ce qui permet à la personne qui annote de voir le document plutôt qu'une reconstitution de celui-ci, et le lien entre pages est ce qui lui permet d'enregistrer qu'une affirmation de la page 2 repose sur un tableau de la page 9.
Liens entre pages
Les relations à l'intérieur d'une page sont courantes. Tous les outils listés ici qui affichent des PDF savent relier deux annotations voisines. Relier par-dessus une frontière de page est plus rare, car l'interface doit alors tenir deux emplacements éloignés à l'écran ou en mémoire en même temps.
Labelbox documente un flux de travail explicite pour cela. La personne qui annote choisit l'outil de relation, fait un clic droit sur la première annotation et sélectionne « Sélectionner le début de la relation » (« Select relationship start »), fait défiler jusqu'à la destination et sélectionne « Sélectionner la fin de la relation » (« Select relationship end »). Potato prend l'autre voie et empile toutes les pages dans un unique conteneur défilant avec view_mode: scroll, si bien que les deux extrémités du lien restent accessibles sans quitter la vue, et trace le lien sous la forme d'un seul arc.
INCEpTION et Kili prennent tous deux en charge les relations sur PDF, et aucune des deux documentations ne dit si une relation peut franchir une page. Traitez cela comme inconnu et non comme un non.
Là où les éditions diffèrent
Label Studio est le cas où l'édition compte davantage que l'outil. Son modèle open source pour les documents de plusieurs pages indique que l'annotation « exige que vous prétraitiez d'abord votre document en le convertissant en images séparées » (« requires that you first pre-process your document by converting it into separate images »), ce qui fait perdre la couche de texte et, avec elle, l'annotation par empans de texte. Le rendu natif des PDF et la balise OcrLabels sont documentés comme des fonctionnalités Enterprise, avec des PDF jusqu'à 100 pages et un pageIndex sur chaque résultat.
Son OCR lit une couche de texte déjà présente plutôt que de reconnaître des caractères dans une image. La documentation est directe sur cette condition et demande de vérifier « si vous pouvez surligner le texte du PDF avec votre curseur » (« whether you can highlight text in the PDF using your cursor »). Une page numérisée demande d'abord une étape d'OCR externe.
Prodigy atteint les PDF via le greffon distinct prodigy-pdf, qui fournit pdf.image.manual pour les boîtes sur les pages rendues, pdf.spans.manual pour les empans sur le texte extrait et pdf.ocr.correct pour relire la sortie de Tesseract. Prodigy est une licence propriétaire à vie, à $390 pour un usage personnel et $490 par poste pour les entreprises, avec un minimum de cinq postes.
doccano et brat sont des outils de texte. Le catalogue d'importateurs livré avec doccano liste TextFile, TextLine, CSV, FastText, JSON, JSONL, Excel, CoNLL, ImageFile et AudioFile, sans importateur PDF parmi eux. brat stocke chaque document sous forme de fichier texte UTF-8 simple, à côté d'un fichier .ann en annotation déportée, si bien que les pages n'ont aucune représentation dans son modèle de données. Les deux sont sous licence MIT et restent de bons choix pour les tâches de texte pour lesquelles elles ont été conçues.
Les formats de médias documentés de CVAT sont les images, la vidéo, l'audio et les nuages de points. Sa documentation ne mentionne pas le PDF, ce qui est une affirmation sur la documentation plutôt que sur le code.
Documents numérisés
C'est sur l'OCR que les outils divergent le plus quant à ce qu'ils font à votre place. Labelbox et Kili reconnaissent le texte à partir des pixels, donc une numérisation fonctionne sans préparation. Kili utilise le texte natif du PDF là où il existe et se rabat sur l'image sinon, et accepte un OCR calculé à l'extérieur via un champ de métadonnées au format Google Vision. Label Studio et INCEpTION exigent tous deux une couche de texte incorporée et vous laissent la reconnaissance.
L'OCR de Potato est optionnel et ne s'exécute qu'en mode lien. L'option ocr accepte false, true ou auto, et auto ne lance la passe que lorsque la couche de texte incorporée revient vide, ce qui convient à un corpus mêlant fichiers nés numériques et numérisations.
instance_display:
fields:
- key: pdf
type: pdf
label: "Document"
display_options:
annotation_mode: link
view_mode: scroll
ocr: auto
enable_text_anchors: true
enable_region_anchors: true
anchor_labels:
- name: claim
color: "#dc2626"
- name: figure
color: "#2563eb"
link_types:
- name: refers_to
directed: true
allowed_source_labels: [claim]
allowed_target_labels: [figure]allowed_source_labels et allowed_target_labels restreignent les ancres qu'un type de lien peut joindre, de sorte qu'un lien refers_to ne peut commencer que sur une affirmation et se terminer que sur une figure. Une consigne exprimée ainsi est appliquée par l'interface au lieu d'être mémorisée par la personne qui annote.
Ce que Potato ne fait pas pour les documents
Potato ne fournit pas de main-d'œuvre d'annotation, alors que Labelbox, Kili et Scale sont bâtis autour de services d'étiquetage gérés. Potato n'a pas de boucle d'entraînement de modèle rattachée à l'annotation de documents, ce que prodigy-pdf offre à travers le reste de Prodigy. L'OCR de Potato ne s'exécute qu'en mode lien, donc une tâche en mode empans sur des numérisations demande que la couche de texte soit ajoutée au préalable.
Les fichiers Word et Markdown passent par l'affichage document de Potato, distinct de l'affichage pdf. Parmi les outils présentés ici, les listes de formats de doccano et d'INCEpTION sont assez explicites pour dire que DOCX en est absent ; les autres ne le mentionnent ni dans un sens ni dans l'autre.
Pour aller plus loin
- Comment annoter des documents et des PDF traite des ancres, des numérisations et de ce que porte la mise en page.
- Annotation de PDF documente toutes les options acceptées par l'affichage
pdf. - Outils d'annotation comparés couvre tous les types de données sur une seule page.
- Outils d'annotation de texte comparés traite de la REN, des relations et de la classification.
Vérifié auprès de la documentation, de la page de tarifs et du dépôt de chaque projet le 2026-09-24. Si une cellule est erronée, dites-le-nous.