Skip to content

文件與 PDF 標註工具對比:開源與付費

對比 Potato、Labelbox、Label Studio、INCEpTION、Kili、Prodigy 和 doccano 在 PDF 標註上的表現,涵蓋原生渲染、區域框、OCR 與跨頁連結。

標註 PDF 需要三樣文本工具不提供的東西:渲染真實的頁面、把標籤錨定到頁面座標,以及把標註跨頁連結起來。Potato、Labelbox、INCEpTION 和 Kili 原生渲染 PDF。記錄瞭如何連結不同頁面上標註的,是 Labelbox 和 Potato 這兩款。Label Studio 的開源版要求先把 PDF 轉成圖片,其原生 PDF 標註是 Enterprise 功能。

PDF 描述的是頁面上的標記,而不是字元序列,所以把它當作抽取出來的文本去標註,會丟掉頁碼、欄序和表格結構。如何標註文件講了這為什麼重要,以及有哪些替代做法。本頁比較各款工具。

本頁只涉及文件。標註工具對比在一頁裡涵蓋所有資料類型。

功能並列對照

下表每一項都是在 2026-09-24 從工具自身的文件中讀到的。短橫線表示文件沒有描述該功能,這與工具拒絕該功能並不是一回事。

工具原生渲染 PDF頁面上的區域框跨頁連結內建 OCR許可證
Potato是是是可選,連結模式下開源
Labelbox是是是是,編輯器內未說明檔位
Kili是是關係是,跨頁未說明是免費試用,之後付費
INCEpTION是僅文本片段關係是,跨頁未說明需要內嵌文本Apache 2.0
Label Studio僅 Enterprise是-讀取已有文本層核心 Apache 2.0,PDF 受限
Prodigy通過 prodigy-pdf 外掛是-是,通過 Tesseract付費,個人 $390
doccano----MIT
brat----MIT
CVAT文件列出圖片、影片、音訊、點雲---開源

多數項目由兩列決定。原生渲染讓標註者看到的是文件本身,而不是對它的重建;跨頁連結讓標註者能記錄第 2 頁的某個論斷依據的是第 9 頁的某張表。

跨頁連結

頁面內部的關係很常見。這裡凡是能渲染 PDF 的工具,都能把相鄰的兩條標註連起來。跨越頁面邊界去連結則少見得多,因為這要求介面同時把兩處相距很遠的位置留在螢幕上或記憶體裡。

Labelbox 為此記錄了明確的操作流程。標註者選擇關係工具,右鍵點選第一條標註並選擇"選擇關係起點"("Select relationship start"),滾動到目標位置後選擇"選擇關係終點"("Select relationship end")。Potato 走的是另一條路,在 view_mode: scroll 下把所有頁面堆疊進一個可滾動容器,於是連結的兩端不用離開當前檢視就都能夠到,連結本身畫成一段弧。

INCEpTION 和 Kili 都支援在 PDF 上建立關係,兩者的文件都沒有說明關係能否跨頁。請把這當作未知,而不是當作否定。

版本之間的差別

Label Studio 是版本比工具本身更關鍵的一例。它面向多頁文件的開源模板寫道,標註"要求你先把文件轉換成一張張單獨的圖片來做預處理"("requires that you first pre-process your document by converting it into separate images"),這會丟掉文本層,連帶丟掉文本片段標註。原生 PDF 渲染和 OcrLabels 標籤被記錄為 Enterprise 功能,PDF 最多 100 頁,每條結果上帶一個 pageIndex。

它的 OCR 讀取的是已經存在的文本層,而不是識別影像裡的字元。文件對這個前提說得很直接,請你先確認"能否用游標在 PDF 裡選中並高亮文本"("whether you can highlight text in the PDF using your cursor")。掃描頁需要先走一步外部 OCR。

Prodigy 通過單獨的 prodigy-pdf 外掛處理 PDF,其中 pdf.image.manual 用於在渲染後的頁面上畫框,pdf.spans.manual 用於在抽取文本上標片段,pdf.ocr.correct 用於校對 Tesseract 的輸出。Prodigy 是專有的終身授權,個人使用 $390,企業按席位計每席 $490,最少五個席位。

doccano 和 brat 是文本工具。doccano 隨附的匯入器清單列有 TextFile、TextLine、CSV、FastText、JSON、JSONL、Excel、CoNLL、ImageFile 和 AudioFile,其中沒有 PDF 匯入器。brat 把每份文件存成純 UTF-8 文本檔案,旁邊放一個獨立的 .ann 檔案,因此頁面在它的資料模型裡沒有對應表示。兩者都是 MIT 許可,也都仍然適合它們當初所面向的文本任務。

CVAT 文件中記載的媒體格式是圖片、影片、音訊和點雲。它的文件沒有提到 PDF,這是關於文件的陳述,而不是關於程式碼庫的陳述。

掃描文件

在替你做多少事這一點上,各工具在 OCR 上的分歧最大。Labelbox 和 Kili 從畫素識別文字,因此掃描件不用準備就能用。Kili 在 PDF 自帶文本存在時使用它,否則回退到影像,並支援通過一個 Google Vision 格式的後設資料欄位接收外部算好的 OCR 結果。Label Studio 和 INCEpTION 都要求內嵌文本層,識別的活留給你自己。

Potato 的 OCR 是可選的,且只在連結模式下執行。ocr 選項接受 false、true 或 auto,auto 只在內嵌文本層返回為空時才跑這一遍,適合數字原生檔案與掃描件混在一起的語料。

yaml
instance_display:
  fields:
    - key: pdf
      type: pdf
      label: "Document"
      display_options:
        annotation_mode: link
        view_mode: scroll
        ocr: auto
        enable_text_anchors: true
        enable_region_anchors: true
        anchor_labels:
          - name: claim
            color: "#dc2626"
          - name: figure
            color: "#2563eb"
        link_types:
          - name: refers_to
            directed: true
            allowed_source_labels: [claim]
            allowed_target_labels: [figure]

allowed_source_labels 和 allowed_target_labels 限定某種連結類型可以連線哪些錨點,於是 refers_to 連結只能從論斷出發,也只能落在圖上。這樣表達出來的規範由介面來執行,而不必靠標註者記住。

Potato 在文件標註上不做的事

Potato 不提供標註人力,而 Labelbox、Kili 和 Scale 都是圍繞託管標註服務建立的。Potato 沒有掛在文件標註上的模型訓練閉環,那是 prodigy-pdf 藉助 Prodigy 的其餘部分提供的。Potato 的 OCR 只在連結模式下執行,所以要在掃描件上做片段模式的任務,得事先補上文本層。

Word 和 Markdown 檔案用的是 Potato 另一個 document 顯示類型,而不是 pdf 顯示類型。在這裡列出的工具中,doccano 和 INCEpTION 的格式清單足夠明確,可以說 DOCX 不在其列;其餘幾款兩方面都沒有提及。

延伸閱讀

已於 2026-09-24 對照各項目的文件、定價頁和程式碼倉庫核查。若有某格寫錯,請告訴我們。