Dokument- und PDF-Annotationswerkzeuge im Vergleich: Open Source und kostenpflichtig
Vergleicht Potato, Labelbox, Label Studio, INCEpTION, Kili, Prodigy und doccano für die Annotation von PDFs, mit nativer Darstellung, Regionsrahmen, OCR und seitenübergreifenden Verknüpfungen.
Eine PDF zu annotieren erfordert drei Dinge, die ein Textwerkzeug nicht bietet: die echte Seite darzustellen, Labels an Seitenkoordinaten zu verankern und Annotationen über Seiten hinweg zu verknüpfen. Potato, Labelbox, INCEpTION und Kili stellen PDFs nativ dar. Labelbox und Potato sind die beiden, die einen Weg dokumentieren, Annotationen auf verschiedenen Seiten zu verknüpfen. Die Open-Source-Ausgabe von Label Studio verlangt, die PDF zuerst in Bilder umzuwandeln, und ihre native PDF-Beschriftung ist eine Enterprise-Funktion.
Eine PDF beschreibt Markierungen auf Seiten statt einer Zeichenfolge, deshalb wirft die Annotation als extrahierter Text die Seitenzahl, die Spaltenreihenfolge und die Tabellenstruktur weg. Dokumente annotieren erklärt, warum das zählt und welche Alternativen es gibt. Diese Seite vergleicht die Werkzeuge.
Diese Seite behandelt nur Dokumente. Annotationswerkzeuge im Vergleich behandelt alle Datentypen auf einer Seite.
Funktionen nebeneinander
Jeder Eintrag unten wurde am 2026-09-24 aus der Dokumentation des jeweiligen Werkzeugs gelesen. Ein Strich bedeutet, dass die Dokumentation die Funktion nicht beschrieben hat, was nicht dasselbe ist, wie wenn das Werkzeug sie verweigert.
| Werkzeug | Stellt PDF nativ dar | Regionsrahmen auf der Seite | Seitenübergreifende Verknüpfungen | Eingebautes OCR | Lizenz |
|---|---|---|---|---|---|
| Potato | Ja | Ja | Ja | Optional, im Link-Modus | Open Source |
| Labelbox | Ja | Ja | Ja | Ja, im Editor | Stufe nicht angegeben |
| Kili | Ja | Ja | Relationen ja, seitenübergreifend nicht angegeben | Ja | Kostenlose Testphase, danach kostenpflichtig |
| INCEpTION | Ja | Nur Textspannen | Relationen ja, seitenübergreifend nicht angegeben | Benötigt eingebetteten Text | Apache 2.0 |
| Label Studio | Nur Enterprise | Ja | - | Liest vorhandene Textebene | Kern Apache 2.0, PDF beschränkt |
| Prodigy | Über das Plugin prodigy-pdf | Ja | - | Ja, über Tesseract | Kostenpflichtig, $390 privat |
| doccano | - | - | - | - | MIT |
| brat | - | - | - | - | MIT |
| CVAT | Doku nennt Bilder, Video, Audio, Punktwolken | - | - | - | Open Source |
Zwei Spalten entscheiden die meisten Projekte. Die native Darstellung lässt eine annotierende Person das Dokument sehen statt einer Rekonstruktion davon, und die seitenübergreifende Verknüpfung erlaubt es ihr festzuhalten, dass eine Behauptung auf Seite 2 auf einer Tabelle auf Seite 9 beruht.
Seitenübergreifende Verknüpfung
Relationen innerhalb einer Seite sind verbreitet. Jedes Werkzeug hier, das PDFs darstellt, kann zwei nahe beieinanderliegende Annotationen verbinden. Über eine Seitengrenze hinweg zu verknüpfen ist seltener, denn die Oberfläche muss dafür zwei weit auseinanderliegende Stellen gleichzeitig auf dem Bildschirm oder im Speicher halten.
Labelbox dokumentiert dafür einen ausdrücklichen Arbeitsablauf. Die annotierende Person wählt das Relationswerkzeug, klickt mit der rechten Maustaste auf die erste Annotation und wählt „Anfang der Relation wählen“ („Select relationship start“), scrollt zum Ziel und wählt „Ende der Relation wählen“ („Select relationship end“). Potato geht den anderen Weg und stapelt in view_mode: scroll alle Seiten in einem einzigen scrollbaren Container, sodass beide Enden der Verknüpfung erreichbar sind, ohne die Ansicht zu verlassen, und zeichnet die Verknüpfung als einen einzigen Bogen.
INCEpTION und Kili unterstützen beide Relationen auf PDFs, und in keiner der beiden Dokumentationen steht, ob eine Relation über Seiten hinweg reichen darf. Behandeln Sie das als unbekannt und nicht als Nein.
Wo sich die Ausgaben unterscheiden
Label Studio ist der Fall, in dem die Ausgabe mehr zählt als das Werkzeug. Die Open-Source-Vorlage für mehrseitige Dokumente sagt, dass die Annotation „verlangt, dass Sie Ihr Dokument zuerst vorverarbeiten, indem Sie es in einzelne Bilder umwandeln“ („requires that you first pre-process your document by converting it into separate images“), was die Textebene verliert und damit die Annotation von Textspannen. Native PDF-Darstellung und das Tag OcrLabels sind als Enterprise-Funktionen dokumentiert, mit PDFs bis 100 Seiten und einem pageIndex an jedem Ergebnis.
Sein OCR liest eine bereits vorhandene Textebene, statt Zeichen in einem Bild zu erkennen. Die Dokumentation ist bei dieser Voraussetzung deutlich und bittet Sie zu prüfen, „ob Sie den Text in der PDF mit dem Cursor markieren können“ („whether you can highlight text in the PDF using your cursor“). Eine gescannte Seite braucht zuerst einen externen OCR-Schritt.
Prodigy erreicht PDFs über das separate Plugin prodigy-pdf, das pdf.image.manual für Rahmen auf dargestellten Seiten liefert, pdf.spans.manual für Spannen auf extrahiertem Text und pdf.ocr.correct für die Durchsicht der Tesseract-Ausgabe. Prodigy ist eine proprietäre Lizenz auf Lebenszeit zu $390 für die private Nutzung und $490 pro Platz für Unternehmen, mit einem Minimum von fünf Plätzen.
doccano und brat sind Textwerkzeuge. Der mitgelieferte Importer-Katalog von doccano listet TextFile, TextLine, CSV, FastText, JSON, JSONL, Excel, CoNLL, ImageFile und AudioFile, ohne einen PDF-Importer darunter. brat speichert jedes Dokument als einfache UTF-8-Textdatei neben einer Standoff-Datei .ann, sodass Seiten in seinem Datenmodell keine Entsprechung haben. Beide stehen unter der MIT-Lizenz, und beide bleiben gute Wahlen für die Textaufgaben, für die sie gebaut wurden.
Die dokumentierten Medienformate von CVAT sind Bilder, Video, Audio und Punktwolken. Seine Dokumentation erwähnt PDF nicht, was eine Aussage über die Dokumentation ist und nicht über die Codebasis.
Gescannte Dokumente
Bei OCR gehen die Werkzeuge am weitesten auseinander in dem, was sie für Sie übernehmen. Labelbox und Kili erkennen Text aus Pixeln, ein Scan funktioniert also ohne Vorbereitung. Kili nutzt den nativen Text der PDF, wo er vorhanden ist, und greift sonst auf das Bild zurück, und nimmt extern berechnetes OCR über ein Metadatenfeld im Google-Vision-Format entgegen. Label Studio und INCEpTION verlangen beide eine eingebettete Textebene und überlassen die Erkennung Ihnen.
Potatos OCR ist optional und läuft nur im Link-Modus. Die Option ocr nimmt false, true oder auto, und auto führt den Durchlauf nur aus, wenn die eingebettete Textebene leer zurückkommt, was zu einem Korpus passt, das digital erzeugte Dateien mit Scans mischt.
instance_display:
fields:
- key: pdf
type: pdf
label: "Document"
display_options:
annotation_mode: link
view_mode: scroll
ocr: auto
enable_text_anchors: true
enable_region_anchors: true
anchor_labels:
- name: claim
color: "#dc2626"
- name: figure
color: "#2563eb"
link_types:
- name: refers_to
directed: true
allowed_source_labels: [claim]
allowed_target_labels: [figure]allowed_source_labels und allowed_target_labels schränken ein, welche Anker ein Verknüpfungstyp verbinden darf, sodass eine refers_to-Verknüpfung nur an einer Behauptung beginnen und nur an einer Abbildung enden kann. Eine so ausgedrückte Richtlinie setzt die Oberfläche durch, statt dass die annotierende Person sie im Kopf behalten muss.
Was Potato für Dokumente nicht tut
Potato stellt keine Belegschaft an Annotierenden bereit, während Labelbox, Kili und Scale um verwaltete Labeling-Dienste herum gebaut sind. Potato hat keine an die Dokumentannotation angeschlossene Modelltrainingsschleife, was prodigy-pdf über den Rest von Prodigy bietet. Potatos OCR läuft nur im Link-Modus, eine Spannen-Aufgabe auf Scans braucht also die vorher hinzugefügte Textebene.
Word- und Markdown-Dateien nutzen Potatos eigene Anzeige document statt der Anzeige pdf. Unter den Werkzeugen hier sind die Formatlisten von doccano und INCEpTION deutlich genug, um zu sagen, dass DOCX fehlt; die übrigen erwähnen es weder so noch so.
Weiterführendes
- Dokumente und PDFs annotieren behandelt Anker, Scans und was das Layout trägt.
- PDF-Annotation dokumentiert jede Option, die die Anzeige
pdfannimmt. - Annotationswerkzeuge im Vergleich behandelt alle Datentypen auf einer Seite.
- Textannotationswerkzeuge im Vergleich behandelt NER, Relationen und Klassifikation.
Geprüft gegen die Dokumentation, die Preisseite und das Repository jedes Projekts am 2026-09-24. Wenn eine Zelle falsch ist, sagen Sie uns Bescheid.