Skip to content

Outils d'annotation de documents et de PDF comparés : open source et payants

Compare Potato, Labelbox, Label Studio, INCEpTION, Kili, Prodigy et doccano pour l'annotation de PDF : rendu natif, boîtes de région, OCR et liens entre pages.

Annoter un PDF demande trois choses qu'un outil de texte ne fournit pas : afficher la page réelle, ancrer les étiquettes à des coordonnées de page et relier des annotations d'une page à l'autre. Potato, Labelbox, INCEpTION et Kili affichent les PDF nativement. Labelbox et Potato sont les deux outils qui documentent un moyen de relier des annotations situées sur des pages différentes. L'édition open source de Label Studio demande de convertir d'abord le PDF en images, et son étiquetage natif de PDF est une fonctionnalité Enterprise.

Un PDF décrit des marques sur des pages plutôt qu'une suite de caractères, si bien que l'annoter sous forme de texte extrait jette le numéro de page, l'ordre des colonnes et la structure des tableaux. Comment annoter des documents explique pourquoi cela compte et quelles sont les solutions de rechange. Cette page compare les outils.

Cette page ne traite que des documents. Outils d'annotation comparés couvre tous les types de données sur une seule page.

Capacités côte à côte

Chaque entrée ci-dessous a été lue dans la documentation de l'outil lui-même le 2026-09-24. Un tiret signifie que la documentation ne décrivait pas la capacité, ce qui n'équivaut pas à un refus de l'outil.

OutilAffiche le PDF nativementBoîtes de région sur la pageLiens entre pagesOCR intégréLicence
PotatoOuiOuiOuiOptionnel, en mode lienOpen source
LabelboxOuiOuiOuiOui, dans l'éditeurNiveau non précisé
KiliOuiOuiRelations oui, entre pages non préciséOuiEssai gratuit, puis payant
INCEpTIONOuiEmpans de texte uniquementRelations oui, entre pages non préciséExige du texte incorporéApache 2.0
Label StudioEnterprise uniquementOui-Lit la couche de texte existanteCœur Apache 2.0, PDF restreint
ProdigyVia le greffon prodigy-pdfOui-Oui, via TesseractPayant, $390 usage personnel
doccano----MIT
brat----MIT
CVATLa doc liste images, vidéo, audio, nuages de points---Open source

Deux colonnes tranchent la plupart des projets. Le rendu natif est ce qui permet à la personne qui annote de voir le document plutôt qu'une reconstitution de celui-ci, et le lien entre pages est ce qui lui permet d'enregistrer qu'une affirmation de la page 2 repose sur un tableau de la page 9.

Liens entre pages

Les relations à l'intérieur d'une page sont courantes. Tous les outils listés ici qui affichent des PDF savent relier deux annotations voisines. Relier par-dessus une frontière de page est plus rare, car l'interface doit alors tenir deux emplacements éloignés à l'écran ou en mémoire en même temps.

Labelbox documente un flux de travail explicite pour cela. La personne qui annote choisit l'outil de relation, fait un clic droit sur la première annotation et sélectionne « Sélectionner le début de la relation » (« Select relationship start »), fait défiler jusqu'à la destination et sélectionne « Sélectionner la fin de la relation » (« Select relationship end »). Potato prend l'autre voie et empile toutes les pages dans un unique conteneur défilant avec view_mode: scroll, si bien que les deux extrémités du lien restent accessibles sans quitter la vue, et trace le lien sous la forme d'un seul arc.

INCEpTION et Kili prennent tous deux en charge les relations sur PDF, et aucune des deux documentations ne dit si une relation peut franchir une page. Traitez cela comme inconnu et non comme un non.

Là où les éditions diffèrent

Label Studio est le cas où l'édition compte davantage que l'outil. Son modèle open source pour les documents de plusieurs pages indique que l'annotation « exige que vous prétraitiez d'abord votre document en le convertissant en images séparées » (« requires that you first pre-process your document by converting it into separate images »), ce qui fait perdre la couche de texte et, avec elle, l'annotation par empans de texte. Le rendu natif des PDF et la balise OcrLabels sont documentés comme des fonctionnalités Enterprise, avec des PDF jusqu'à 100 pages et un pageIndex sur chaque résultat.

Son OCR lit une couche de texte déjà présente plutôt que de reconnaître des caractères dans une image. La documentation est directe sur cette condition et demande de vérifier « si vous pouvez surligner le texte du PDF avec votre curseur » (« whether you can highlight text in the PDF using your cursor »). Une page numérisée demande d'abord une étape d'OCR externe.

Prodigy atteint les PDF via le greffon distinct prodigy-pdf, qui fournit pdf.image.manual pour les boîtes sur les pages rendues, pdf.spans.manual pour les empans sur le texte extrait et pdf.ocr.correct pour relire la sortie de Tesseract. Prodigy est une licence propriétaire à vie, à $390 pour un usage personnel et $490 par poste pour les entreprises, avec un minimum de cinq postes.

doccano et brat sont des outils de texte. Le catalogue d'importateurs livré avec doccano liste TextFile, TextLine, CSV, FastText, JSON, JSONL, Excel, CoNLL, ImageFile et AudioFile, sans importateur PDF parmi eux. brat stocke chaque document sous forme de fichier texte UTF-8 simple, à côté d'un fichier .ann en annotation déportée, si bien que les pages n'ont aucune représentation dans son modèle de données. Les deux sont sous licence MIT et restent de bons choix pour les tâches de texte pour lesquelles elles ont été conçues.

Les formats de médias documentés de CVAT sont les images, la vidéo, l'audio et les nuages de points. Sa documentation ne mentionne pas le PDF, ce qui est une affirmation sur la documentation plutôt que sur le code.

Documents numérisés

C'est sur l'OCR que les outils divergent le plus quant à ce qu'ils font à votre place. Labelbox et Kili reconnaissent le texte à partir des pixels, donc une numérisation fonctionne sans préparation. Kili utilise le texte natif du PDF là où il existe et se rabat sur l'image sinon, et accepte un OCR calculé à l'extérieur via un champ de métadonnées au format Google Vision. Label Studio et INCEpTION exigent tous deux une couche de texte incorporée et vous laissent la reconnaissance.

L'OCR de Potato est optionnel et ne s'exécute qu'en mode lien. L'option ocr accepte false, true ou auto, et auto ne lance la passe que lorsque la couche de texte incorporée revient vide, ce qui convient à un corpus mêlant fichiers nés numériques et numérisations.

yaml
instance_display:
  fields:
    - key: pdf
      type: pdf
      label: "Document"
      display_options:
        annotation_mode: link
        view_mode: scroll
        ocr: auto
        enable_text_anchors: true
        enable_region_anchors: true
        anchor_labels:
          - name: claim
            color: "#dc2626"
          - name: figure
            color: "#2563eb"
        link_types:
          - name: refers_to
            directed: true
            allowed_source_labels: [claim]
            allowed_target_labels: [figure]

allowed_source_labels et allowed_target_labels restreignent les ancres qu'un type de lien peut joindre, de sorte qu'un lien refers_to ne peut commencer que sur une affirmation et se terminer que sur une figure. Une consigne exprimée ainsi est appliquée par l'interface au lieu d'être mémorisée par la personne qui annote.

Ce que Potato ne fait pas pour les documents

Potato ne fournit pas de main-d'œuvre d'annotation, alors que Labelbox, Kili et Scale sont bâtis autour de services d'étiquetage gérés. Potato n'a pas de boucle d'entraînement de modèle rattachée à l'annotation de documents, ce que prodigy-pdf offre à travers le reste de Prodigy. L'OCR de Potato ne s'exécute qu'en mode lien, donc une tâche en mode empans sur des numérisations demande que la couche de texte soit ajoutée au préalable.

Les fichiers Word et Markdown passent par l'affichage document de Potato, distinct de l'affichage pdf. Parmi les outils présentés ici, les listes de formats de doccano et d'INCEpTION sont assez explicites pour dire que DOCX en est absent ; les autres ne le mentionnent ni dans un sens ni dans l'autre.

Pour aller plus loin

Vérifié auprès de la documentation, de la page de tarifs et du dépôt de chaque projet le 2026-09-24. Si une cellule est erronée, dites-le-nous.