Skip to content

Herramientas de anotación de documentos y PDF comparadas: código abierto y de pago

Compara Potato, Labelbox, Label Studio, INCEpTION, Kili, Prodigy y doccano para anotar PDF, con representación nativa, cajas de región, OCR y enlaces entre páginas.

Anotar un PDF exige tres cosas que una herramienta de texto no ofrece: representar la página real, anclar las etiquetas a coordenadas de página y enlazar anotaciones entre páginas. Potato, Labelbox, INCEpTION y Kili representan PDF de forma nativa. Labelbox y Potato son las dos que documentan una manera de enlazar anotaciones situadas en páginas distintas. La edición de código abierto de Label Studio pide convertir antes el PDF en imágenes, y su etiquetado nativo de PDF es una función de Enterprise.

Un PDF describe marcas sobre páginas en lugar de una secuencia de caracteres, así que anotarlo como texto extraído descarta el número de página, el orden de las columnas y la estructura de las tablas. Cómo anotar documentos explica por qué eso importa y cuáles son las alternativas. Esta página compara las herramientas.

Esta página trata solo de documentos. Herramientas de anotación comparadas cubre todos los tipos de datos en una sola página.

Capacidades una al lado de otra

Cada entrada de abajo se leyó en la documentación de la propia herramienta el 2026-09-24. Un guion significa que la documentación no describió la capacidad, que no es lo mismo que la herramienta rechazarla.

HerramientaRepresenta PDF de forma nativaCajas de región en la páginaEnlaces entre páginasOCR integradoLicencia
PotatoSíSíSíOpcional, en modo enlaceCódigo abierto
LabelboxSíSíSíSí, en el editorNivel no indicado
KiliSíSíRelaciones sí, entre páginas no indicadoSíPrueba gratuita y luego de pago
INCEpTIONSíSolo tramos de textoRelaciones sí, entre páginas no indicadoNecesita texto incrustadoApache 2.0
Label StudioSolo en EnterpriseSí-Lee la capa de texto existenteNúcleo Apache 2.0, PDF restringido
ProdigyMediante el complemento prodigy-pdfSí-Sí, mediante TesseractDe pago, $390 uso personal
doccano----MIT
brat----MIT
CVATLa documentación enumera imágenes, vídeo, audio y nubes de puntos---Código abierto

Dos columnas deciden la mayoría de los proyectos. La representación nativa es lo que permite a quien anota ver el documento en lugar de una reconstrucción suya, y el enlace entre páginas es lo que le permite registrar que una afirmación de la página 2 se apoya en una tabla de la página 9.

Enlaces entre páginas

Las relaciones dentro de una misma página son habituales. Toda herramienta de esta lista que represente PDF puede unir dos anotaciones cercanas entre sí. Enlazar a través del límite de una página es más raro, porque exige que la interfaz mantenga a la vez dos posiciones distantes en pantalla o en memoria.

Labelbox documenta un flujo de trabajo explícito para ello. Quien anota selecciona la herramienta de relación, hace clic derecho en la primera anotación y elige «Seleccionar inicio de la relación» («Select relationship start»), se desplaza hasta el destino y elige «Seleccionar fin de la relación» («Select relationship end»). Potato adopta el otro enfoque y apila todas las páginas en un único contenedor desplazable con view_mode: scroll, de modo que ambos extremos del enlace quedan al alcance sin salir de la vista, y dibuja el enlace como un solo arco.

INCEpTION y Kili admiten relaciones sobre PDF, y la documentación de ninguna de las dos indica si una relación puede abarcar varias páginas. Trátalo como desconocido y no como un no.

En qué difieren las ediciones

Label Studio es el caso en el que la edición importa más que la herramienta. Su plantilla de código abierto para documentos de varias páginas dice que la anotación «exige que primero preproceses tu documento convirtiéndolo en imágenes separadas» («requires that you first pre-process your document by converting it into separate images»), lo que pierde la capa de texto y con ella la anotación de tramos de texto. La representación nativa de PDF y la etiqueta OcrLabels están documentadas como funciones de Enterprise, con PDF de hasta 100 páginas y un pageIndex en cada resultado.

Su OCR lee una capa de texto que ya existe en lugar de reconocer caracteres en una imagen. La documentación es directa sobre ese requisito y pide comprobar «si puedes resaltar el texto del PDF con el cursor» («whether you can highlight text in the PDF using your cursor»). Una página escaneada necesita antes un paso externo de OCR.

Prodigy llega a los PDF a través del complemento aparte prodigy-pdf, que aporta pdf.image.manual para cajas sobre páginas representadas, pdf.spans.manual para tramos sobre texto extraído y pdf.ocr.correct para revisar la salida de Tesseract. Prodigy es una licencia propietaria de por vida a $390 para uso personal y $490 por puesto para empresas, con un mínimo de cinco puestos.

doccano y brat son herramientas de texto. El catálogo de importadores que trae doccano enumera TextFile, TextLine, CSV, FastText, JSON, JSONL, Excel, CoNLL, ImageFile y AudioFile, sin ningún importador de PDF entre ellos. brat guarda cada documento como un archivo de texto UTF-8 plano junto a un archivo .ann independiente, de modo que las páginas no tienen representación en su modelo de datos. Ambas están bajo licencia MIT y ambas siguen siendo buenas opciones para las tareas de texto para las que se construyeron.

Los formatos de medios documentados de CVAT son imágenes, vídeo, audio y nubes de puntos. Su documentación no menciona PDF, lo cual es una afirmación sobre la documentación y no sobre el código.

Documentos escaneados

El OCR es donde más divergen las herramientas en lo que harán por ti. Labelbox y Kili reconocen texto a partir de los píxeles, así que un escaneo funciona sin preparación. Kili usa el texto nativo del PDF donde existe y recurre a la imagen en los demás casos, y acepta OCR calculado externamente mediante un campo de metadatos en formato Google Vision. Label Studio e INCEpTION exigen una capa de texto incrustada y dejan el reconocimiento en tus manos.

El OCR de Potato es opcional y solo se ejecuta en modo enlace. La opción ocr acepta false, true o auto, y auto ejecuta la pasada solo cuando la capa de texto incrustada vuelve vacía, lo que encaja con un corpus que mezcla archivos de origen digital con escaneos.

yaml
instance_display:
  fields:
    - key: pdf
      type: pdf
      label: "Document"
      display_options:
        annotation_mode: link
        view_mode: scroll
        ocr: auto
        enable_text_anchors: true
        enable_region_anchors: true
        anchor_labels:
          - name: claim
            color: "#dc2626"
          - name: figure
            color: "#2563eb"
        link_types:
          - name: refers_to
            directed: true
            allowed_source_labels: [claim]
            allowed_target_labels: [figure]

allowed_source_labels y allowed_target_labels restringen qué anclas puede unir un tipo de enlace, de modo que un enlace refers_to solo puede empezar en una afirmación y terminar en una figura. Una pauta expresada así la impone la interfaz en lugar de recordarla quien anota.

Lo que Potato no hace con los documentos

Potato no aporta una plantilla de anotadores, y Labelbox, Kili y Scale están construidas en torno a servicios gestionados de etiquetado. Potato no lleva un ciclo de entrenamiento de modelos adosado a la anotación de documentos, que es lo que ofrece prodigy-pdf a través del resto de Prodigy. El OCR de Potato solo se ejecuta en modo enlace, así que una tarea en modo tramos sobre escaneos necesita que se añada antes la capa de texto.

Los archivos de Word y Markdown usan la visualización document de Potato, distinta de la visualización pdf. Entre las herramientas de aquí, las listas de formatos de doccano y de INCEpTION son lo bastante explícitas para decir que DOCX no está; las demás no lo mencionan en un sentido ni en otro.

Lecturas adicionales

Comprobado con la documentación, la página de precios y el repositorio de cada proyecto el 2026-09-24. Si alguna celda está mal, dínoslo.