Skip to content

AI 주석 도구 비교: 오픈소스와 유료

텍스트, 비전, 3D, 에이전트 평가를 아우르는 14개 주석 도구와 플랫폼 비교. 어떤 도구가 AI로 사전 라벨링을 하는지, 각 무료 버전에 실제로 무엇이 포함되는지 정리했습니다.

주석 도구는 텍스트, 이미지, 오디오, 비디오 또는 모델 출력에 레이블을 붙여 그 결과로 시스템을 학습시키거나 평가할 수 있게 하는 소프트웨어입니다. 이 가이드는 모달리티 지원 범위, AI 보조 레이블링, 일치도 지표, 그리고 각 무료 버전에 실제로 포함되는 것을 기준으로 오픈소스와 상용 도구 14개를 비교합니다.

단 하나의 최고 도구란 없습니다. 올바른 선택은 무엇에 주석을 다는지, 예산이 얼마인지, 에이전트나 LLM 평가가 필요한지, 그리고 설정 작업을 어디까지 감당할 수 있는지에 따라 달라집니다.

어떤 주석 도구를 비교해야 하나요?

도구라이선스강점적합한 경우
Potato무료, 오픈소스(연구용)텍스트/이미지/오디오/비디오/3D/로보틱스에 걸친 61가지 작업 유형, 에이전트 및 LLM 평가, 코드가 필요 없는 YAML, 내장 일치도 지표연구, 에이전트/LLM 평가, 코드 없이 빠른 설정
Label Studio오픈소스 + 유료 등급폭넓은 모달리티 지원, 세련된 UI, 큰 생태계상업적 지원을 받는 플랫폼을 원하는 팀
Prodigy유료(상업용)스크립트 작성 가능, 능동 학습 우선, spaCy와의 긴밀한 통합유료의 코드 중심 도구를 잘 다루는 spaCy 사용자
Doccano오픈소스단순하고 깔끔하며 자체 호스팅이 쉬움단순한 텍스트 분류 및 NER
brat오픈소스성숙한 리치 텍스트/관계 주석엔티티와 관계의 언어학적 주석
INCEpTION오픈소스풍부한 언어학적 주석, 지식 베이스 링크설정에 투자할 수 있는 본격적인 언어학 프로젝트
Argilla오픈소스LLM 데이터에 초점, Hugging Face와의 통합HF 스택에서의 피드백/RLHF 데이터 수집
CVAT오픈소스이미지/비디오 컴퓨터 비전 주석바운딩 박스, 마스크, 비디오 CV 라벨링
Labelbox / Scale상업용(유료)매니지드 플랫폼, 대규모 인력 서비스도구와 라벨링 인력을 함께 구매하는 기업

(세부 사항은 시간이 지나며 바뀝니다. 현재의 라이선스와 기능은 각 프로젝트에서 확인합니다.)

라이선스 열이 가리는 것이 있습니다. 무료 플랜에 실제로 무엇이 들어 있는지입니다. Label Studio 커뮤니티 버전에는 어노테이터 간 일치도 지표가 아예 없고, 정답 데이터 표시와 품질 대시보드는 사용자당 월 99달러부터입니다. Prodigy에는 무료 플랜이 없습니다. CVAT는 품질 관리 화면을 유료로 명시합니다. 모달리티 범위가 아니라 품질 관리로 고른다면, 마케팅 페이지가 아니라 무료 버전을 비교하세요. 열한 개 도구의 기능 매트릭스를 각 제품 문서와 대조해 정리해 두었습니다.

AI로 사전 레이블링을 하는 주석 도구는 무엇인가요?

"AI 주석 도구"라는 표현은 대개 하나로 묶여 판매되는 세 가지 능력을 아우르며, 그중 하나를 갖춘 도구가 나머지를 갖추지 못한 경우가 많습니다.

  • 모델 보조 지오메트리. 대략적으로 클릭하거나 그리면 세그멘테이션 모델이 경계를 조여줍니다. Potato는 이를 GPU 없이 브라우저에서 실행하고, CVAT는 Nuclio 또는 AI 에이전트 경로로, Label Studio는 ML 백엔드로 접근하며, Roboflow, V7, Supervisely, Segments.ai는 제품에 내장해 제공합니다.
  • 프롬프트 기반 레이블링. 고정된 목록에서 고르는 대신 객체 이름을 입력하면 마스크나 박스를 돌려받습니다. Potato, Roboflow, V7이 이를 지원합니다. 이름을 입력해 객체에 레이블 붙이기를 참고하세요.
  • LLM 및 VLM 사전 주석. 모델이 배치 전체에 레이블을 제안하고 어노테이터가 이를 검토합니다. Potato는 이 용도로 13가지 엔드포인트 유형에 연결할 수 있으며, 완료된 주석을 비전-언어 모델이 비평하게 할 수도 있습니다.

사전 레이블링은 품질 관리가 잡아내야 할 대상을 바꿉니다. 제안을 읽지 않고 받아들이는 어노테이터는 정확도를 떨어뜨리면서 모든 일치도 수치를 끌어올리며, 검토와 형식적 승인을 가르는 유일한 신호는 소요 시간입니다. 형식적으로 승인된 사전 레이블 가려내기를 참고하세요.

Potato는 모델을 학습시키지도, 서빙하지도 않습니다. 항목을 정렬하고, 지정한 모델을 호출하며, 어노테이터가 그 결과로 무엇을 했는지 기록합니다.

비전, 3D, 모델 평가

Potato의 컴퓨터 비전, 공간, 평가 기능은 텍스트 기능보다 나중에 나왔습니다. 아래 표는 도구에 순위를 매기는 대신 각 도구가 어디에 강한지를 기록한 것입니다.

기능PotatoCVATLabel StudioRoboflowV7SuperviselySegments.ai
무료 자체 호스팅예(MIT)커뮤니티 버전--커뮤니티 버전-
박스, 폴리곤, 마스크
대화형 분할브라우저 내, GPU 불필요Nuclio 경유ML 백엔드 경유
텍스트 프롬프트 분할예(브라우저 내)-ML 백엔드 경유예(SAM 3)예(SAM 3)앱 경유-
키포인트/스켈레톤
폴리라인, 타원, 2D 직육면체일부일부
객체별 속성-
보간이 있는 비디오 트래킹일부일부
모델 기반 마스크 전파예(SAM 2, 서버 측)AI 에이전트 경유ML 백엔드 경유
딥 줌/기가픽셀예(DZI + IIIF)일부---
3D 포인트 클라우드와 직육면체---
포인트 클라우드 시퀀스----
센서 퓨전(2D↔3D)일부---
윈도잉이 되는 깊이 맵---일부--
DICOM / NIfTI / WSI-----
같은 제품 안에서의 모델 학습-일부--
CV 형식 가져오기15개 형식광범위일부광범위일부광범위일부
기하 주석에 대한 우연 보정 일치도------
로봇 에피소드(LeRobot, RLDS, HDF5)------
생성 비디오/월드 모델 평가------
VLM 그라운딩 및 포인팅 평가------

대부분의 행에서는 성숙한 CV 플랫폼이 Potato와 같거나 더 낫습니다. 체크 표시로만 보고 넘기지 말고 자세히 읽어야 할 행이 둘 있습니다. Potato의 텍스트 프롬프트 분할은 Apache-2.0 모델로 브라우저 안에서 돌아가지만, 상업용 동급 기능은 SAM 3의 비상업 조건 아래 서버 측에서 돌아갑니다. 그리고 Potato의 마스크 전파는 서버에서 돌아가므로, 무료로 기능 자체는 쓸 수 있지만 브라우저 안에서는 아닙니다. 마지막 네 행에서는 Potato가 다른 도구들이 제공하지 않는 일을 하고 있습니다.

대량 처리 컴퓨터 비전

CVAT은 오픈소스 CV 도구의 기준이며, CV만 대량으로 처리하는 파이프라인에서는 여전히 더 나은 선택입니다. 작업과 잡 관리가 더 깊고, 객체별 속성이 있으며, Datumaro를 통한 형식 생태계가 더 크고, 커뮤니티도 아주 큽니다. CV 작업이 텍스트, 오디오, 평가 작업과 나란히 놓일 때, 또는 정답 잡 대비 정확도가 아니라 어노테이터 간 일치도가 필요할 때 Potato를 고르세요.

목표가 학습된 모델이라면 Roboflow가 훌륭합니다. Smart Polygon, 일괄 자동 라벨링, 자체 모델을 쓰는 Label Assist, 그리고 호스팅형 학습과 배포가 하나의 루프 안에 있습니다. Potato는 검출기를 학습시키지 않습니다. 라벨 자체가 연구 산출물이고 그 신뢰성을 근거로 내세워야 할 때 Potato를 고르세요.

Labelbox, SuperAnnotate, Encord, Kili, V7은 인력 관리, 기업용 거버넌스, 강력한 모델 보조 라벨링을 갖춘 성숙한 상업 플랫폼입니다. 관리형 인력, 규정 준수 인증, 페타바이트 규모의 큐레이션이 필요하다면 이들이 정답입니다.

X-AnyLabeling은 Grounding DINO, Grounded-SAM 2, SAM 2.1, YOLO를 데스크톱 앱 하나에 담았고, 한 사람이 로컬에서 다양한 모델로 라벨링한다면 이기기 어렵습니다. Potato는 더 좁은 모델 집합을 제공하고 브라우저에서 돌아가므로 어노테이터의 기기에는 아무것도 설치하지 않습니다. 그 장점은 어노테이터가 둘 이상일 때부터 살아납니다.

기가픽셀과 디지털 병리

Potato는 타일 피라미드를 만들어 DZI와 IIIF Image API 3.0 양쪽으로 제공하며, 마스크 버퍼가 GPU 텍스처가 아니라 이미지 픽셀을 인덱싱하기 때문에 브러시 마스크는 원본의 전체 해상도에서 동작합니다.

디지털 병리에 한정하면 QuPath(데스크톱, 오픈소스, 이 분야의 표준)와 Cytomine(웹, 오픈소스, 블라인드 주석을 지원하는 다중 사용자)이 이 목적으로 만들어졌고, Potato는 SVS, DICOM, NIfTI를 읽지 못합니다. 이미지가 크지만 임상 형식은 아닐 때, 또는 그 위에 Potato의 일치도와 워크플로 계층이 필요할 때 Potato를 쓰세요.

3D와 센서 퓨전

Segments.ai, Kognic, Deepen AI, Supervisely, Xtreme1/BasicAI는 전문 도구이며, 실제 운영되는 자율주행 파이프라인에서는 앞서 있습니다. 트랙 전파가 되는 시퀀스와 에피소드 워크플로, 레이더와 다중 LiDAR 지원, 직육면체를 자동으로 맞추는 모델, 객체별 속성 온톨로지, 그리고 Deepen의 경우 타깃 없는 캘리브레이션 제품 일체까지 갖췄습니다. Supervisely와 Xtreme1은 둘 다 자체 호스팅할 수 있고, Supervisely는 훨씬 큰 클라우드를 다룹니다.

공간 라벨에 대한 신뢰도 통계가 필요하거나 3D가 멀티모달 연구의 한 부분일 때 3D에는 Potato를 고르세요.

로보틱스, 월드 모델, 그라운딩

로봇 에피소드에서는 ATLAS(빈 공과대학교)가 장기 구간 행동 분할에 집중한 데스크톱 도구로, ROS bag과 RLDS를 기본 지원하며 단일 어노테이터의 경계 정밀도를 위해 만들어졌습니다. ELANBORIS는 여전히 행동 코딩의 표준이고, RerunFoxglove는 최고의 로보틱스 시각화 도구입니다.

생성 비디오에서는 생태계 대부분이 벤치마크(VBench, WorldModelBench, Physics-IQ)와 대규모 선호 수집을 위한 크라우드 패널로 이루어져 있습니다. 그쪽은 지표와 참조 프로토콜을 제공하고, Potato는 사람 쪽 평가를 신뢰도를 재면서 반복 수행하기 위한 도구를 제공하므로, 경쟁이 아니라 보완 관계입니다.

VLM 그라운딩에서는 이 영역이 주석 제품이 아니라 데이터셋과 평가 하네스(RefCOCO, PixMo-Points, PointBench, lmms-eval, VLMEvalKit)로 정의됩니다. Potato의 역할은 그 벤치마크들이 딛고 선 사람의 정답 데이터를 모으고 재는 것입니다.

Potato가 하지 못하는 일

평가 후반에 가서야 알게 되는 일이 없도록 미리 적어 둡니다.

  • 모델을 학습시키지 않습니다. Potato는 항목의 순서를 정하고, 기존 모델로 사전 라벨을 붙이며, VLM으로 주석을 비평합니다. 검출기를 학습시키거나 서빙하지는 않습니다. Roboflow, V7, Supervisely, Labelbox는 합니다.
  • 아직 객체별 속성이 없습니다. 기하 도형은 라벨 하나를 가집니다. 가림 정도, 잘림 플래그, 하위 유형 속성에는 별도의 스키마를 함께 써야 합니다.
  • 포인트 클라우드 시퀀스 모드가 없습니다. 3D 주석은 프레임 단위이고, 한 스윕 전체에 걸친 트랙 전파는 구현되어 있지 않습니다.
  • DICOM, NIfTI, WSI를 지원하지 않습니다. 딥 줌과 16비트 윈도잉이 감당하는 것은 큰 과학 이미지이지 임상 이미지가 아닙니다.
  • 관리형 인력, SAML/SCIM, 규정 준수 인증이 없습니다. Potato는 직접 돌리는 소프트웨어입니다. RBAC과 OAuth는 지원하지만 기업용 거버넌스는 지원하지 않습니다.

기능 개수

범주Potato
주석 스키마61
표시 유형24
내보내기 형식29
가져오기 형식15
AI/LLM 엔드포인트 유형13
데이터 소스 유형8
배정 전략11
설문 척도55
크라우드소싱 연동9
워크플로 단계8

이 개수는 Potato 자체 레지스트리에서 생성한 것입니다. "최선의 대안" 열은 없습니다. 위 도구들이 기능을 정리하는 방식이 충분히 달라서, 숫자 하나로 비교하면 오해를 부르기 때문입니다.

주석 도구를 어떻게 선택하나요?

  • 무엇에 주석을 다는가? 텍스트 전용 NER이라면 Doccano나 brat이 단순합니다. 텍스트/이미지/오디오/비디오가 섞여 있다면 Potato와 Label Studio가 그 범위를 폭넓게 다룹니다.
  • 에이전트나 LLM 평가가 필요한가? 바로 여기서 Potato가 남다릅니다. 다양한 형식의 에이전트 추적을 읽어 들이고, 궤적, 프로세스 보상, 웹 에이전트, 코딩 에이전트, 멀티 에이전트 팀, 컴퓨터 사용/멀티모달 평가를 위한 전용 도구를 갖추고 있습니다. 대부분의 범용 도구에는 이것이 없습니다.
  • 예산. Potato, Label Studio(코어), Doccano, brat, Argilla는 무료이며 오픈소스입니다. Prodigy와 일부 Label Studio 등급은 유료입니다.
  • 설정 부담. Potato는 YAML 파일로 설정하며 코드가 필요 없습니다. Prodigy는 코드 우선이고, 나머지는 그 중간에 있습니다.
  • 생태계. Prodigy는 spaCy와, Argilla는 Hugging Face와 결합됩니다. Potato는 CoNLL, spaCy, Hugging Face, COCO/YOLO를 포함한 여러 ML 형식으로 내보냅니다.

Potato는 언제 적합한 주석 도구인가요?

Potato는 학술 NLP에서 출발했습니다. 최초 시스템은 EMNLP 2022에서, Potato 2.0은 ACL 2026에서 발표되었고, 연구 워크플로 전체를 위해 만들어졌습니다. 다양한 작업 유형, 곧바로 쓸 수 있는 품질 관리와 일치도 지표, 크라우드소싱 연동, 그리고 폭넓은 AI 에이전트 평가 도구 모음을 갖추고 있습니다. 작업이 여러 모달리티에 걸쳐 있거나 LLM과 에이전트 평가를 포함한다면, 살펴볼 가치가 있습니다.

호스팅형 상업 제품으로 단일 텍스트 작업만 필요하거나, spaCy 또는 Hugging Face 안에서 모든 것이 완결된다면, 다른 도구 중 하나가 더 잘 맞을 수 있습니다.

자주 묻는 질문

가장 좋은 무료 주석 도구는 무엇인가요?

모달리티에 따라 다릅니다. 텍스트만 다루는 분류와 NER이라면 Doccano와 brat이 가장 손쉽게 띄울 수 있습니다. 하나의 프로젝트에 텍스트, 이미지, 오디오, 비디오가 섞여 있다면 Potato와 Label Studio 커뮤니티 버전 모두 그 범위를 감당하며, 차이는 품질 관리에서 드러납니다. Potato는 일치도 지표와 품질 대시보드를 무료로 제공하지만, Label Studio는 이를 유료 등급에 둡니다. 대량 처리 컴퓨터 비전이라면 CVAT가 무료이면서 성숙합니다.

Potato는 Label Studio의 무료 대안인가요?

그렇습니다. Potato는 무료이며 오픈소스이고, 단일 YAML 설정에서 코드 없이 텍스트, 이미지, 오디오, 비디오, 그리고 에이전트/LLM 평가까지 다룹니다. Label Studio는 일부 통합에서는 더 폭넓지만 팀을 유료 등급으로 유도합니다. 반면 Potato는 무료이며 자체 호스팅 방식을 유지하므로, 학술 연구와 재현 가능한 연구 작업에 적합합니다.

Potato는 Prodigy의 무료 오픈소스 대안인가요?

그렇습니다. Prodigy는 spaCy와 긴밀하게 결합된, 훌륭한 유료의 코드 우선 도구입니다. Potato는 무료이고 코드 없이 YAML로 설정하며, spaCy, CoNLL, Hugging Face 형식으로 내보냅니다. 상업용 라이선스 없이 능동 학습을 사용하고 싶다면, Potato가 오픈소스 선택지입니다.

언어학적 주석에서 Potato는 INCEpTION과 어떻게 비교되나요?

INCEpTION은 본격적인 언어학적 주석과 지식 베이스 링크에 강력하지만 배포가 더 무겁습니다. Potato는 시작하기가 더 간단해 YAML 파일 하나와 명령 하나면 되며, INCEpTION의 본격적인 언어학적 기능이 필요 없는 스팬, 관계, 분류 작업에서는 대체로 더 빠릅니다.

Labelbox나 Scale AI 같은 상업 플랫폼 대신 Potato를 사용하는 이유는 무엇인가요?

Labelbox와 Scale은 매니지드 플랫폼과 라벨링 인력을 판매하며, 그 둘을 함께 구매하는 기업에 적합합니다. 자체 어노테이터를 데려오고 데이터를 자사 서버에 두어야 하는 연구 팀에게는, Potato가 무료이며 자체 호스팅 방식인 대안이며, 어노테이터 간 일치도 지표가 내장되어 있습니다.

AI 에이전트 궤적을 주석하기에 가장 좋은 오픈소스 도구는 무엇인가요?

바로 여기서 Potato가 범용 주석 도구 가운데 남다릅니다. 15가지 형식으로 에이전트 트레이스를 읽어 들이고, 궤적, 스텝 수준, 웹 에이전트, 코딩 에이전트 평가를 위한 전용 화면을 갖추고 있습니다. 또한 클릭 가능한 상호작용 그래프에서 멀티 에이전트 팀을 주석하고, 컴퓨터 사용 및 음성 에이전트 같은 멀티모달 에이전트도 주석합니다. 오픈소스든 상업용이든 대부분의 도구는 에이전트 실행을 전혀 주석하지 못합니다.

Potato가 관찰 가능성 도구나 라벨링 플랫폼이 할 수 없는 무엇을 평가할 수 있나요?

에이전트 어노테이션의 두 가지 범주로, Potato와 흔히 비교되는 도구들(LangSmith, Langfuse, Labelbox, Scale AI, Label Studio, Argilla, Braintrust)에서는 어느 것도 구성 가능한 자체 호스팅 기능으로 제공되지 않습니다. 2026년 6월 기준으로 각 도구의 문서를 확인한 결과입니다.

  • 멀티 에이전트 팀 구조. 어노테이터가 편집할 수 있는 상호작용 그래프(임계 경로 표시, 잘못된 핸드오프 플래그), 책임 에이전트 / 결정적 단계 / 이유의 삼중항으로 표현되는 교차 에이전트 실패 귀인, 일급 객체로서의 핸드오프 리뷰, 에이전트별·팀별 스코어카드, 도구 경합 타임라인, 창발적 동작 태깅. 다른 곳에서 가장 비슷한 것은 Langfuse의 "Agent Graphs"이지만, 이는 어노테이션 화면이 아니라 읽기 전용 디버깅 뷰입니다.
  • 멀티모달 에이전트. 클릭 그라운딩 마커가 있는 컴퓨터 사용 궤적, 끼어들기(barge-in) 점수화가 있는 풀 듀플렉스 음성 타임라인, 모델이 예측한 구간에 대한 실시간 IoU가 있는 비디오 시간적 그라운딩. Scale AI는 GUI 그라운딩과 음성 평가를 수행하지만 관리형 데이터셋 작업으로 제공하며, 그 음성 아레나는 풀 듀플렉스가 아니라 턴 기반입니다.

관찰 가능성 도구들(LangSmith, Langfuse, Braintrust)은 span 수준의 점수와 코멘트를 붙이는데, 이는 실제 단계별 어노테이션이지만 이러한 에이전트 구조 화면은 아닙니다. 라벨링 플랫폼들(Labelbox, Scale)은 에이전트 평가 데이터 제품을 제공하지만, 자체 호스팅하고 YAML로 구성하는 도구가 아니라 유료 클라우드 또는 관리형 서비스입니다. 역량은 빠르게 바뀌므로 이는 2026년 6월 시점의 스냅숏을 반영하며, 전체 비교 글에 확인한 버전들이 정리되어 있습니다.

더 읽어보기