Skip to content

文書・PDFアノテーションツール比較:オープンソースと有償

PDFのアノテーションについてPotato、Labelbox、Label Studio、INCEpTION、Kili、Prodigy、doccanoを比較し、ネイティブ表示、領域ボックス、OCR、ページをまたぐリンクを扱います。

PDFのアノテーションには、テキストツールでは用意されない三つのものが要ります。実際のページを描画すること、ラベルをページ座標に固定すること、そしてアノテーションをページをまたいでリンクすることです。Potato、Labelbox、INCEpTION、KiliはPDFをネイティブに描画します。異なるページにあるアノテーション同士をリンクする方法を文書化しているのは、LabelboxとPotatoの二つです。Label Studioのオープンソース版は先にPDFを画像へ変換するよう求めており、ネイティブなPDFラベリングはEnterpriseの機能です。

PDFは文字の並びではなくページ上の印を記述するため、抽出したテキストとしてアノテーションすると、ページ番号も段組の順序も表の構造も失われます。文書のアノテーション方法では、なぜそれが問題になるのか、どんな代替手段があるのかを扱っています。このページではツールを比較します。

このページは文書だけを扱います。アノテーションツール比較は、あらゆるデータ型を一つのページで扱います。

機能の対照

以下の各項目は、2026-09-24 に各ツール自身のドキュメントから読み取りました。ダッシュは、ドキュメントがその機能を記述していなかったという意味であり、ツールがそれを拒むという意味ではありません。

ツールPDFをネイティブに描画ページ上の領域ボックスページをまたぐリンク内蔵OCRライセンス
Potatoありありあり任意、リンクモードでオープンソース
Labelboxありありありあり、エディタ内提供区分の記載なし
Kiliありあり関係はあり、ページをまたぐ可否は記載なしあり無料試用、その後有償
INCEpTIONありテキストスパンのみ関係はあり、ページをまたぐ可否は記載なし埋め込みテキストが必要Apache 2.0
Label StudioEnterpriseのみあり-既存のテキスト層を読むコアはApache 2.0、PDFは制限あり
Prodigyprodigy-pdf プラグイン経由あり-あり、Tesseract経由有償、個人 $390
doccano----MIT
brat----MIT
CVATドキュメントには画像、動画、音声、点群---オープンソース

たいていのプロジェクトは二つの列で決まります。ネイティブ描画は、作業者に文書の再構成ではなく文書そのものを見せるものであり、ページをまたぐリンクは、2ページ目の主張が9ページ目の表に基づくと記録できるようにするものです。

ページをまたぐリンク

ページ内の関係はよくあります。ここに挙げたPDFを描画するツールはどれも、近くにある二つのアノテーションをつなげます。ページの境界をまたいでリンクする方は珍しく、離れた二か所を画面上またはメモリ上に同時に保持することがインターフェースに求められるからです。

Labelboxはそのための明示的な操作手順を文書化しています。作業者は関係ツールを選び、最初のアノテーションを右クリックして「関係の始点を選択」("Select relationship start")を選び、目的の位置までスクロールして「関係の終点を選択」("Select relationship end")を選びます。Potatoは別の方針を取り、view_mode: scroll で全ページを一つのスクロール可能なコンテナに積み重ねるので、ビューを離れずにリンクの両端へ届き、リンクは一本の弧として描かれます。

INCEpTIONとKiliはどちらもPDF上の関係に対応しており、関係がページをまたげるかどうかは、どちらのドキュメントにも書かれていません。これは「いいえ」ではなく不明として扱ってください。

エディションによる違い

Label Studioは、ツールそのものよりエディションが効いてくる例です。複数ページ文書向けのオープンソースのテンプレートには、アノテーションには「まず文書を別々の画像に変換して前処理しておく必要があります」("requires that you first pre-process your document by converting it into separate images")と書かれており、これによってテキスト層が失われ、テキストスパンのアノテーションも失われます。ネイティブなPDF描画と OcrLabels タグはEnterpriseの機能として文書化されており、PDFは最大100ページ、各結果に pageIndex が付きます。

そのOCRは、画像中の文字を認識するのではなく、すでに存在するテキスト層を読みます。ドキュメントはこの要件について率直で、「カーソルでPDF内のテキストをハイライトできるかどうか」("whether you can highlight text in the PDF using your cursor")を確認するよう求めています。スキャンしたページには、先に外部のOCR工程が必要です。

Prodigyは別売の prodigy-pdf プラグインを通じてPDFに届きます。描画されたページ上のボックスには pdf.image.manual、抽出テキスト上のスパンには pdf.spans.manual、Tesseractの出力の確認には pdf.ocr.correct が用意されています。Prodigyはプロプライエタリな買い切りライセンスで、個人利用は $390、企業は1シートあたり $490、5シートからとなっています。

doccanoとbratはテキスト向けのツールです。doccanoに同梱のインポータ一覧には、TextFile、TextLine、CSV、FastText、JSON、JSONL、Excel、CoNLL、ImageFile、AudioFileが並び、その中にPDFインポータはありません。bratは各文書をプレーンなUTF-8テキストファイルとして保存し、その横にスタンドオフの .ann ファイルを置くため、データモデルにページの表現がありません。どちらもMITライセンスで、どちらも本来作られたテキスト作業には引き続き良い選択肢です。

CVATが文書化しているメディア形式は、画像、動画、音声、点群です。そのドキュメントはPDFに触れておらず、これはコードベースについてではなくドキュメントについての言明です。

スキャン文書

何をこちらの代わりにやってくれるかという点で、ツールの差が最も大きく出るのがOCRです。LabelboxとKiliはピクセルから文字を認識するので、スキャンでも下準備なしで動きます。KiliはPDFのネイティブテキストがあればそれを使い、なければ画像に切り替え、Google Vision形式のメタデータフィールドを通じて外部で計算したOCRも受け付けます。Label StudioとINCEpTIONはどちらも埋め込みのテキスト層を必要とし、認識は利用者に任せます。

PotatoのOCRは任意で、リンクモードでのみ動きます。ocr オプションは false、true、auto を取り、auto は埋め込みテキスト層が空で返ってきたときだけ処理を走らせるので、デジタル生まれのファイルとスキャンが混ざったコーパスに向きます。

yaml
instance_display:
  fields:
    - key: pdf
      type: pdf
      label: "Document"
      display_options:
        annotation_mode: link
        view_mode: scroll
        ocr: auto
        enable_text_anchors: true
        enable_region_anchors: true
        anchor_labels:
          - name: claim
            color: "#dc2626"
          - name: figure
            color: "#2563eb"
        link_types:
          - name: refers_to
            directed: true
            allowed_source_labels: [claim]
            allowed_target_labels: [figure]

allowed_source_labels と allowed_target_labels は、あるリンク型がどのアンカー同士をつなげるかを制限するので、refers_to リンクは主張から始まり図で終わることしかできません。こう表したガイドラインは、作業者が覚えておくのではなくインターフェースが守らせます。

文書についてPotatoがやらないこと

Potatoは作業者の人手を用意しませんし、Labelbox、Kili、Scaleはマネージドのラベリングサービスを軸に作られています。Potatoには文書アノテーションに紐づくモデル学習のループがなく、それは prodigy-pdf がProdigyの他の部分を通じて提供するものです。PotatoのOCRはリンクモードでしか動かないので、スキャンに対するスパンモードの作業では、テキスト層をあらかじめ付けておく必要があります。

WordとMarkdownのファイルは、pdf ディスプレイではなくPotatoの別の document ディスプレイを使います。ここに挙げたツールのうち、doccanoとINCEpTIONの形式一覧はDOCXがないと言い切れるほど明確です。他のツールはどちらとも述べていません。

さらに読む

2026-09-24 に各プロジェクトのドキュメント、価格ページ、リポジトリと突き合わせて確認しました。誤りのあるセルがあればお知らせください。