Skip to content

이미지 어노테이션 도구 비교: CVAT, Label Studio, Roboflow, V7, Potato

CVAT, Label Studio, Roboflow, V7, Supervisely, Segments.ai, X-AnyLabeling, VIA, Potato를 박스, 세그멘테이션, 키포인트, 기가픽셀 이미지, 3D 포인트 클라우드 기준으로 비교합니다.

대량의 컴퓨터 비전 레이블링에는 CVAT이 기준이 되는 오픈소스 도구이고, Roboflow, V7, Supervisely는 모델 학습이나 관리형 워크플로를 더한 상용 제품입니다. Potato는 이미지 레이블이 연구 데이터일 때 적합합니다. 여러 어노테이터가 같은 이미지에 레이블을 붙이고, 연구에서 이들의 일치도를 보고해야 하는 경우입니다. 이미지가 텍스트, 오디오, 모델 출력과 같은 연구에 함께 들어갈 때도 잘 맞습니다.

바운딩 박스는 객체를 둘러싼 사각형입니다. 이미지 세그멘테이션은 픽셀을 폴리곤이나 마스크 형태로 객체에 할당합니다. 키포인트는 관절 같은 기준점을 표시하고, 스켈레톤이 이를 연결합니다. IoU(Intersection over Union)는 두 도형이 얼마나 겹치는지 측정하며, 대부분의 도구가 어노테이터 비교에 사용합니다.

이 페이지는 이미지, 기가픽셀 슬라이드, 3D 포인트 클라우드를 다룹니다. 모든 데이터 유형을 한 페이지에서 비교한 내용은 AI 주석 도구 비교에 있습니다.

비교해 볼 만한 이미지 어노테이션 도구는?

도구실행 방식비용적합한 경우
Potato자체 호스팅 (GPL-3.0)무료일치도를 보고하는 다중 어노테이터 연구
CVAT자체 호스팅 (MIT) 또는 호스팅무료. 호스팅은 사용자당 월 33달러대량의 박스, 마스크, 비디오 추적
Label Studio자체 호스팅 또는 호스팅Community Edition 무료. 유료 플랜은 월 99달러부터텍스트, 오디오, 비디오도 레이블링하는 프로젝트의 이미지
Roboflow호스팅상용레이블에서 학습·배포된 검출기까지 가기
V7호스팅상용관리형 워크플로, 의료 영상 형식, 모델 보조 레이블링
Supervisely자체 호스팅 또는 호스팅Community Edition과 상용 등급큰 이미지, 3D, 같은 제품 안에서의 모델 학습
Segments.ai호스팅상용3D 포인트 클라우드와 센서 퓨전
X-AnyLabeling데스크톱 앱무료한 사람이 여러 모델로 로컬에서 레이블링하기
VIA브라우저에서 오프라인으로 실행되는 단일 HTML 파일무료 (BSD-2-Clause)설치 없는 소규모 프로젝트

박스, 폴리곤, 키포인트

여기 있는 도구는 모두 박스와 폴리곤을 그립니다. CVAT, Label Studio, Roboflow, V7, Supervisely, Segments.ai, Potato는 스켈레톤이 있는 키포인트도 지원합니다. Potato는 폴리라인, 타원, 2D 직육면체, 인스턴스별 브러시 마스크를 더 갖추고 있습니다.

성숙한 컴퓨터 비전 플랫폼은 가림 정도, 잘림 표시, 하위 유형 같은 속성을 객체마다 붙입니다. Potato는 아직 지원하지 않습니다. 도형에는 레이블 하나만 붙고, 추가 속성에는 별도의 보조 스키마가 필요합니다.

모델의 도움을 받는 세그멘테이션

인터랙티브 세그멘테이션은 클릭이나 대략적인 윤곽을 딱 맞는 마스크로 바꿉니다. Potato는 이를 브라우저에서 실행하므로 GPU를 준비할 필요가 없습니다. CVAT은 Nuclio 함수나 AI 에이전트 경로로, Label Studio는 ML 백엔드로 이 기능을 씁니다. Roboflow, V7, Supervisely, Segments.ai는 제품에 내장하고 있습니다.

텍스트 프롬프트 세그멘테이션은 이름을 입력한 객체의 마스크를 돌려줍니다. Potato는 Apache-2.0 라이선스 모델로 이를 브라우저에서 실행합니다. Roboflow와 V7은 자사 서버에서 SAM 3를 쓰고, Supervisely는 앱으로, Label Studio는 ML 백엔드로 제공합니다. X-AnyLabeling은 Grounding DINO, Grounded-SAM 2, SAM 2.1, YOLO를 데스크톱 앱 하나에 묶었고, 한 사람이 여러 모델로 로컬에서 레이블링한다면 이기기 어렵습니다. Potato의 장점은 어노테이터가 두 명 이상일 때 시작됩니다.

이미지 세그멘테이션 마스크 어노테이션 방법이름을 입력해 객체 레이블링하기를 참고하세요.

기가픽셀 이미지와 병리 슬라이드

Potato는 타일 피라미드를 만들어 DZI와 IIIF Image API 3.0 두 가지로 제공합니다. 마스크 버퍼가 GPU 텍스처가 아니라 이미지 픽셀을 인덱싱하므로 브러시 마스크가 원본의 전체 해상도에서 동작하며, 텍스처 크기 상한이 없습니다. 16비트 과학용 TIFF에는 백분위수 창이 적용되어 희미한 구조도 보입니다. V7과 Supervisely도 매우 큰 이미지를 다루며, CVAT은 일부 지원합니다. 딥 줌을 이용한 기가픽셀 이미지 어노테이션을 참고하세요.

디지털 병리에는 QuPath(오픈소스 데스크톱 앱, 이 분야의 표준)와 Cytomine(여러 사용자의 블라인드 어노테이션을 지원하는 오픈소스 웹 앱)이라는 전용 도구가 있습니다. Potato는 SVS, DICOM, NIfTI를 읽지 못합니다.

3D 포인트 클라우드

Potato는 PCD, PLY, LAS, KITTI .bin, .xyz 클라우드에 3D 직육면체, 점, 폴리라인, 점별 세그먼트로 어노테이션합니다. 직육면체의 회전을 쿼터니언으로 저장하므로 피치와 롤이 변환을 오가도 사라지지 않고, 직육면체끼리는 회전을 고려한 정확한 3D IoU로 비교합니다. 어노테이션은 프레임 단위입니다.

Segments.ai, Kognic, Deepen AI, Supervisely, Xtreme1/BasicAI는 전문 도구이며, 자율주행 프로덕션 파이프라인에서는 이쪽이 앞서 있습니다. 트랙 전파가 있는 시퀀스 워크플로, 레이더와 다중 LiDAR 지원, 자동으로 맞춰지는 직육면체를 제공합니다. CVAT, Supervisely, Segments.ai는 포인트 클라우드 시퀀스를 다루지만 Potato는 다루지 않습니다. 3D 포인트 클라우드 어노테이션 방법을 참고하세요.

이미지 레이블의 일치도 측정

컴퓨터 비전 도구 대부분은 어노테이터를 겹침으로 비교합니다. CVAT의 합의 엔진과 V7의 합의 단계는 클래스별 임계값에 대해 원시 IoU로 어노테이터를 비교하고, Label Studio Enterprise는 완전 일치, 수치 차이, IoU, 스팬 겹침을 지표로 듭니다. 이 중 어느 것도 우연을 보정하지 않으며, 큰 객체 위에 그린 두 박스의 IoU는 둘 다 대충 그려도 높게 나옵니다.

Potato는 도형의 일치도를 경험적 우연 기준선과 함께 보고합니다. 공간 레이블에 대해 우연을 보정한 일치도를 보고하는 어노테이션 플랫폼을 저희는 달리 찾지 못했습니다. 방법은 바운딩 박스의 어노테이터 간 일치도 측정 방법에서 설명합니다.

사전 레이블링은 두 번째 문제를 낳습니다. 모델 제안을 확인하지 않고 받아들이는 어노테이터는 일치도 수치를 모두 끌어올리면서 정확도는 떨어뜨립니다. Potato는 그리기 시간을 기록하며, 이를 통해 검토한 제안과 그냥 통과시킨 제안을 구분합니다. 검토 없이 통과시킨 사전 레이블 찾기를 참고하세요.

형식

Potato는 15가지 컴퓨터 비전 형식을 가져오며, 그중 11가지는 가져오기와 내보내기를 오갈 수 있습니다. COCO, YOLO, Pascal VOC, CVAT, LabelMe, Cityscapes, KITTI, V7 Darwin, PNG 마스크, MOT, DAVIS로 내보냅니다. 컴퓨터 비전 형식을 참고하세요.

이미지마다 어노테이터 두 명이 붙는 바운딩 박스 작업

yaml
agreement_metrics:
  enabled: true
 
annotation_schemes:
  - annotation_type: image_annotation
    name: objects
    description: "Draw a tight box around every vehicle."
    source_field: image
    tools: [bbox]
    labels:
      - {name: car, color: "#FF6B6B"}
      - {name: truck, color: "#4ECDC4"}
 
num_annotators_per_item:
  default: 2

각 이미지는 어노테이터 두 명에게 배정되고, 관리자 대시보드에 박스에 대한 두 사람의 일치도가 표시됩니다.

이미지에서 Potato가 하지 않는 것

  • 모델 학습을 하지 않습니다. Potato는 기존 모델로 사전 레이블링은 하지만 검출기를 학습시키지는 않습니다. Roboflow, V7, Supervisely, Labelbox는 학습합니다.
  • 객체별 속성은 아직 지원하지 않습니다.
  • 포인트 클라우드 시퀀스를 지원하지 않습니다. 3D 어노테이션은 프레임 단위입니다.
  • DICOM, NIfTI, 전체 슬라이드 형식을 지원하지 않습니다.
  • 관리형 인력을 제공하지 않습니다. 직접 어노테이터를 구하거나 Prolific에서 모집하세요.

2026년 8월과 9월에 각 프로젝트의 문서와 가격 페이지에서 확인했습니다.

자주 묻는 질문

가장 좋은 무료 이미지 어노테이션 도구는 무엇인가요?

컴퓨터 비전만 다루는 대량 작업이라면 CVAT이 무료이고 성숙하며 자체 호스팅이 됩니다. 텍스트나 오디오도 레이블링하는 프로젝트의 이미지라면 Label Studio Community Edition과 Potato 모두 폭넓게 지원합니다. 여러 어노테이터가 같은 이미지에 레이블을 붙이고 일치도를 보고해야 하는 연구라면 Potato가 이를 무료로 제공합니다. 설치 없이 이미지 몇 장을 다룬다면 VIA가 HTML 파일 하나로 실행됩니다.

Labelbox의 오픈소스 대안이 있나요?

CVAT, Label Studio Community Edition, Potato는 오픈소스이며 자체 호스팅됩니다. Labelbox는 관리형 플랫폼과 레이블링 인력을 판매합니다. 오픈소스 도구는 소프트웨어를 제공할 뿐 어노테이터를 제공하지 않으므로, 자체 팀을 쓰거나 Prolific 같은 플랫폼에서 모집합니다.

GPU 서버 없이 모델 보조 세그멘테이션을 쓸 수 있나요?

네. Potato는 인터랙티브 세그멘테이션과 텍스트 프롬프트 세그멘테이션을 ONNX Runtime Web으로 브라우저에서 실행하며, 모델 가중치가 컴퓨터에 있으면 네트워크 없이도 동작합니다. SAM 2를 이용한 비디오 마스크 전파는 서버에서 실행됩니다. X-AnyLabeling은 데스크톱에서 로컬로 모델을 실행합니다. CVAT과 Label Studio는 모델 서버를 호출합니다.

바운딩 박스에서 어노테이터 간 일치도는 어떻게 측정하나요?

각 이미지를 두 명 이상의 어노테이터에게 배정하고, 박스를 짝지은 뒤, 우연을 고려한 일치도를 보고하세요. 큰 객체에서는 어노테이터가 무엇을 하든 원시 IoU가 높게 나오기 때문입니다. 바운딩 박스 일치도 가이드에서 짝짓기, 우연 기준선, 보고할 내용을 다룹니다.

3D 포인트 클라우드에는 어떤 어노테이션 도구를 써야 하나요?

시퀀스와 트랙 전파가 필요한 프로덕션 주행 데이터라면 Segments.ai, Kognic, Supervisely 같은 전문 도구를, 오픈소스여야 한다면 CVAT을 쓰세요. 일치도 통계가 필요한 프레임 단위 직육면체이거나 3D가 멀티모달 연구의 일부라면 Potato가 맞습니다.

더 읽어보기