Skip to content

문서 및 PDF 어노테이션 도구 비교: 오픈 소스와 유료

PDF 어노테이션을 위해 Potato, Labelbox, Label Studio, INCEpTION, Kili, Prodigy, doccano를 비교하며 네이티브 렌더링, 영역 상자, OCR, 페이지를 넘나드는 링크를 다룹니다.

PDF에 어노테이션을 달려면 텍스트 도구가 제공하지 않는 세 가지가 필요합니다. 실제 페이지를 렌더링하는 것, 레이블을 페이지 좌표에 고정하는 것, 그리고 어노테이션을 페이지를 넘나들며 연결하는 것입니다. Potato, Labelbox, INCEpTION, Kili는 PDF를 네이티브로 렌더링합니다. 서로 다른 페이지에 있는 어노테이션을 연결하는 방법을 문서화한 것은 Labelbox와 Potato 두 가지입니다. Label Studio의 오픈 소스 에디션은 PDF를 먼저 이미지로 변환하도록 요구하며, 네이티브 PDF 레이블링은 Enterprise 기능입니다.

PDF는 문자의 나열이 아니라 페이지 위의 표시를 기술하므로, 추출한 텍스트로 어노테이션하면 페이지 번호와 단 순서, 표 구조가 버려집니다. 문서 어노테이션 방법에서 그것이 왜 중요한지와 어떤 대안이 있는지 다룹니다. 이 페이지에서는 도구를 비교합니다.

이 페이지는 문서만 다룹니다. 어노테이션 도구 비교는 모든 데이터 유형을 한 페이지에서 다룹니다.

기능 나란히 보기

아래의 모든 항목은 2026-09-24에 각 도구의 자체 문서에서 읽은 것입니다. 대시는 문서가 해당 기능을 서술하지 않았다는 뜻이며, 도구가 그것을 거부한다는 뜻은 아닙니다.

도구PDF 네이티브 렌더링페이지 위 영역 상자페이지를 넘나드는 링크내장 OCR라이선스
Potato예예예선택 사항, 링크 모드에서오픈 소스
Labelbox예예예예, 에디터 내에서등급 미기재
Kili예예관계는 예, 페이지를 넘나드는지는 미기재예무료 체험 후 유료
INCEpTION예텍스트 스팬만관계는 예, 페이지를 넘나드는지는 미기재내장 텍스트 필요Apache 2.0
Label StudioEnterprise에서만예-기존 텍스트 레이어를 읽음코어는 Apache 2.0, PDF는 제한
Prodigyprodigy-pdf 플러그인을 통해예-예, Tesseract를 통해유료, 개인용 $390
doccano----MIT
brat----MIT
CVAT문서에 이미지, 비디오, 오디오, 포인트 클라우드---오픈 소스

대부분의 프로젝트는 두 열에서 결정됩니다. 네이티브 렌더링은 작업자가 문서를 재구성한 결과가 아니라 문서 자체를 보게 해 주고, 페이지를 넘나드는 링크는 2쪽의 주장이 9쪽의 표에 근거한다는 사실을 기록하게 해 줍니다.

페이지를 넘나드는 링크

한 페이지 안의 관계는 흔합니다. 여기서 PDF를 렌더링하는 도구라면 가까이 놓인 두 어노테이션을 잇습니다. 페이지 경계를 넘어 연결하는 일은 더 드문데, 인터페이스가 멀리 떨어진 두 위치를 화면이나 메모리에 동시에 붙들고 있어야 하기 때문입니다.

Labelbox는 이를 위한 명시적인 작업 흐름을 문서화합니다. 작업자는 관계 도구를 선택하고, 첫 어노테이션을 오른쪽 클릭해 "관계 시작 선택"("Select relationship start")을 고른 뒤, 목적지까지 스크롤해 "관계 끝 선택"("Select relationship end")을 고릅니다. Potato는 다른 길을 택해 view_mode: scroll에서 모든 페이지를 하나의 스크롤 가능한 컨테이너에 쌓으므로, 화면을 벗어나지 않고도 링크의 양 끝에 닿을 수 있으며, 링크는 하나의 호로 그려집니다.

INCEpTION과 Kili는 둘 다 PDF에서 관계를 지원하며, 관계가 페이지를 넘어설 수 있는지는 어느 쪽 문서에도 적혀 있지 않습니다. 이는 아니라고 보기보다 알 수 없음으로 다루십시오.

에디션에 따라 달라지는 지점

Label Studio는 도구보다 에디션이 더 중요한 사례입니다. 여러 쪽짜리 문서를 위한 오픈 소스 템플릿은 어노테이션이 "문서를 먼저 개별 이미지로 변환해 전처리할 것을 요구한다"("requires that you first pre-process your document by converting it into separate images")고 밝히는데, 이렇게 하면 텍스트 레이어가 사라지고 그와 함께 텍스트 스팬 어노테이션도 사라집니다. 네이티브 PDF 렌더링과 OcrLabels 태그는 Enterprise 기능으로 문서화되어 있으며, PDF는 최대 100쪽, 각 결과에 pageIndex가 붙습니다.

이 도구의 OCR은 이미지 속 문자를 인식하는 대신 이미 존재하는 텍스트 레이어를 읽습니다. 문서는 이 요건을 분명히 밝히며 "커서로 PDF의 텍스트를 하이라이트할 수 있는지"("whether you can highlight text in the PDF using your cursor") 확인하라고 안내합니다. 스캔된 페이지에는 외부 OCR 단계가 먼저 필요합니다.

Prodigy는 별도의 prodigy-pdf 플러그인을 통해 PDF에 닿습니다. 렌더링된 페이지 위의 상자에는 pdf.image.manual, 추출된 텍스트 위의 스팬에는 pdf.spans.manual, Tesseract 출력 검토에는 pdf.ocr.correct를 제공합니다. Prodigy는 독점 영구 라이선스로, 개인 사용은 $390, 기업은 좌석당 $490이며 최소 다섯 좌석입니다.

doccano와 brat은 텍스트 도구입니다. doccano에 포함된 임포터 목록에는 TextFile, TextLine, CSV, FastText, JSON, JSONL, Excel, CoNLL, ImageFile, AudioFile이 있으며, 그중 PDF 임포터는 없습니다. brat은 각 문서를 일반 UTF-8 텍스트 파일로 저장하고 그 옆에 스탠드오프 .ann 파일을 두기 때문에, 데이터 모델에 페이지를 나타낼 자리가 없습니다. 둘 다 MIT 라이선스이며, 둘 다 본래 만들어진 텍스트 작업에는 여전히 좋은 선택입니다.

CVAT가 문서화한 미디어 형식은 이미지, 비디오, 오디오, 포인트 클라우드입니다. 그 문서는 PDF를 언급하지 않는데, 이는 코드베이스가 아니라 문서에 대한 진술입니다.

스캔된 문서

도구가 무엇까지 대신해 주는지는 OCR에서 가장 크게 갈립니다. Labelbox와 Kili는 픽셀에서 텍스트를 인식하므로 스캔본도 준비 없이 작동합니다. Kili는 PDF의 네이티브 텍스트가 있으면 그것을 쓰고 없으면 이미지로 되돌아가며, Google Vision 형식의 메타데이터 필드를 통해 외부에서 계산한 OCR도 받아들입니다. Label Studio와 INCEpTION은 둘 다 내장 텍스트 레이어를 요구하고 인식은 사용자에게 맡깁니다.

Potato의 OCR은 선택 사항이며 링크 모드에서만 실행됩니다. ocr 옵션은 false, true, auto를 받고, auto는 내장 텍스트 레이어가 비어서 돌아올 때만 이 과정을 실행하므로, 디지털로 생성된 파일과 스캔본이 섞인 말뭉치에 알맞습니다.

yaml
instance_display:
  fields:
    - key: pdf
      type: pdf
      label: "Document"
      display_options:
        annotation_mode: link
        view_mode: scroll
        ocr: auto
        enable_text_anchors: true
        enable_region_anchors: true
        anchor_labels:
          - name: claim
            color: "#dc2626"
          - name: figure
            color: "#2563eb"
        link_types:
          - name: refers_to
            directed: true
            allowed_source_labels: [claim]
            allowed_target_labels: [figure]

allowed_source_labels와 allowed_target_labels는 한 링크 유형이 어떤 앵커를 이을 수 있는지 제한하므로, refers_to 링크는 주장에서만 시작해 그림에서만 끝날 수 있습니다. 이렇게 표현된 지침은 작업자가 기억하는 대신 인터페이스가 지키게 합니다.

문서 작업에서 Potato가 하지 않는 일

Potato는 작업 인력을 제공하지 않으며, Labelbox와 Kili, Scale은 관리형 레이블링 서비스를 중심으로 만들어졌습니다. Potato에는 문서 어노테이션에 붙은 모델 학습 루프가 없는데, 그것은 prodigy-pdf가 Prodigy의 나머지 부분을 통해 제공하는 것입니다. Potato의 OCR은 링크 모드에서만 실행되므로, 스캔본에 대한 스팬 모드 작업에는 텍스트 레이어를 미리 넣어 두어야 합니다.

Word와 Markdown 파일은 pdf 디스플레이가 아니라 Potato의 별도 document 디스플레이를 씁니다. 여기 실린 도구 가운데 doccano와 INCEpTION의 형식 목록은 DOCX가 없다고 말할 만큼 분명합니다. 나머지는 어느 쪽으로도 언급하지 않습니다.

더 읽어보기

2026-09-24에 각 프로젝트의 문서와 가격 페이지, 저장소를 대조해 확인했습니다. 틀린 칸이 있으면 알려 주십시오.