影像標註工具對比:CVAT、Label Studio、Roboflow、V7 與 Potato
從邊界框、分割、關鍵點、十億畫素影像和 3D 點雲幾個方面對比 CVAT、Label Studio、Roboflow、V7、Supervisely、Segments.ai、X-AnyLabeling、VIA 與 Potato。
大規模計算機視覺標註,CVAT 是參考級的開源工具;Roboflow、V7 和 Supervisely 作為商業產品,額外提供模型訓練或託管的工作流。當影像標籤是研究資料時,Potato 更合適:多名標註者標註同一批影像,研究需要報告他們的一致程度。當影像與文本、音訊或模型輸出出現在同一項研究中時,它也合適。
邊界框是圍住物體的矩形。影像分割把畫素分配給物體,形式可以是多邊形或掩碼。關鍵點標出關節之類的標誌點,骨架把它們連起來。交併比(IoU)衡量兩個形狀的重疊程度,大多數工具用它來比較標註者。
本頁討論影像、十億畫素切片和 3D 點雲。所有資料類型放在一頁裡的對比見 AI 標註工具對比。
哪些影像標註工具值得比較?
| 工具 | 執行方式 | 費用 | 適合 |
|---|---|---|---|
| Potato | 自行部署(GPL-3.0) | 免費 | 需要報告一致性的多標註者研究 |
| CVAT | 自行部署(MIT)或託管 | 免費;託管版每使用者每月 33 美元 | 大批次的邊界框、掩碼和影片跟蹤 |
| Label Studio | 自行部署或託管 | Community Edition 免費;付費方案每月 99 美元起 | 同時標註文本、音訊或影片的項目中的影像 |
| Roboflow | 託管 | 商業 | 從標籤一路做到訓練並部署檢測器 |
| V7 | 託管 | 商業 | 託管工作流、醫學影像格式、模型輔助標註 |
| Supervisely | 自行部署或託管 | Community Edition;另有商業版本 | 大影像、3D,以及在同一產品中訓練模型 |
| Segments.ai | 託管 | 商業 | 3D 點雲與感測器融合 |
| X-AnyLabeling | 桌面應用 | 免費 | 一個人在本地用多種模型標註 |
| VIA | 單個 HTML 檔案,在瀏覽器中離線執行 | 免費(BSD-2-Clause) | 不裝任何東西的小項目 |
邊界框、多邊形和關鍵點
這裡的每個工具都能畫邊界框和多邊形。CVAT、Label Studio、Roboflow、V7、Supervisely、Segments.ai 和 Potato 還支援帶骨架的關鍵點。Potato 另外提供折線、橢圓、2D 立方體,以及按實例區分的畫筆掩碼。
成熟的計算機視覺平臺可以給每個物體附加屬性,例如遮擋程度、截斷標記或子類型。Potato 目前還不支援。在 Potato 中,幾何形狀只帶一個標籤,其他屬性需要配合一個額外的方案。
藉助模型進行分割
互動式分割把一次點選或一個粗略輪廓變成貼合的掩碼。Potato 在瀏覽器裡執行它,不需要準備 GPU。CVAT 通過 Nuclio 函式或其 AI 智慧體途徑實現,Label Studio 通過 ML 後端實現。Roboflow、V7、Supervisely 和 Segments.ai 把它內建在產品中。
文本提示分割會為你說出名字的物體返回掩碼。Potato 用一個 Apache-2.0 許可的模型在瀏覽器中執行它。Roboflow 和 V7 在自己的伺服器上使用 SAM 3,Supervisely 通過應用提供,Label Studio 通過 ML 後端提供。X-AnyLabeling 把 Grounding DINO、Grounded-SAM 2、SAM 2.1 和 YOLO 打包進一個桌面應用,對於一個人在本地用多種模型標註的情況,很難找到更好的選擇。Potato 的優勢在標註者多於一人時才開始顯現。
十億畫素影像與病理切片
Potato 構建瓦片金字塔,同時以 DZI 和 IIIF Image API 3.0 提供。畫筆掩碼在源影像的全解析度下工作,因為掩碼緩衝區索引的是影像畫素而不是 GPU 紋理,所以沒有紋理尺寸上限。16 位科學 TIFF 會使用百分位視窗,讓暗淡的結構仍然可見。V7 和 Supervisely 也能處理超大影像,CVAT 部分支援。見基於深度縮放的十億畫素影像標註。
數字病理方面,QuPath(開源桌面應用,該領域的標準)和 Cytomine(開源網頁應用,支援多使用者盲標)是專門為此打造的。Potato 不讀取 SVS、DICOM 或 NIfTI。
3D 點雲
Potato 用 3D 立方體、點、折線和逐點分段來標註 PCD、PLY、LAS、KITTI .bin 和 .xyz 點雲。立方體的旋轉以四元數儲存,因此俯仰和橫滾在往返轉換中不會丟失;立方體之間用精確的旋轉 3D IoU 來比較。標註按幀進行。
Segments.ai、Kognic、Deepen AI、Supervisely 和 Xtreme1/BasicAI 是專用工具,在自動駕駛生產流水線上領先:帶軌跡傳播的序列工作流、雷達和多雷射雷達支援,以及自動擬合的立方體。CVAT、Supervisely 和 Segments.ai 能處理點雲序列,Potato 不能。見如何標註 3D 點雲。
衡量影像標籤的一致性
大多數計算機視覺工具按重疊來比較標註者。CVAT 的共識引擎和 V7 的共識階段,都是用原始 IoU 對照每個類別的閾值來比較標註者;Label Studio Enterprise 列出的指標是精確匹配、數值差、IoU 和片段重疊。這些方法都不校正偶然一致,而且在大物體上,兩個框即使都畫得很隨意,IoU 也會很高。
Potato 報告幾何形狀上的一致性,並附帶經驗性的偶然基線。我們沒有找到其他在空間標籤上報告經偶然校正的一致性的標註平臺。方法見如何衡量邊界框上的標註者間一致性。
預標註還帶來第二個問題。不加檢查就接受模型建議的標註者,會把各項一致性數字都抬高,同時降低準確性。Potato 記錄繪製時的時間資訊,據此可以區分經過審閱的建議和直接放行的建議。見識別未經審閱就接受的預標註。
格式
Potato 能匯入 15 種計算機視覺格式,其中 11 種可以往返轉換。它可以匯出 COCO、YOLO、Pascal VOC、CVAT、LabelMe、Cityscapes、KITTI、V7 Darwin、PNG 掩碼、MOT 和 DAVIS。見計算機視覺格式。
每張影像兩名標註者的邊界框任務
agreement_metrics:
enabled: true
annotation_schemes:
- annotation_type: image_annotation
name: objects
description: "Draw a tight box around every vehicle."
source_field: image
tools: [bbox]
labels:
- {name: car, color: "#FF6B6B"}
- {name: truck, color: "#4ECDC4"}
num_annotators_per_item:
default: 2每張影像分給兩名標註者,管理後臺會報告他們在邊界框上的一致性。
Potato 在影像上不做的事
- 不訓練模型。 Potato 用現有模型做預標註,但不訓練檢測器。Roboflow、V7、Supervisely 和 Labelbox 可以。
- 暫不支援逐物體屬性。
- 不支援點雲序列。 3D 標註按幀進行。
- 不支援 DICOM、NIfTI 或全切片格式。
- 不提供託管的標註人員。 請自帶標註者,或在 Prolific 上招募。
以上內容於 2026 年 8 月和 9 月對照各項目的文件和價格頁核實。
常見問題
最好的免費影像標註工具是哪個?
如果是隻有計算機視覺的大批次工作,CVAT 免費、成熟且可自行部署。如果影像所在的項目還要標註文本或音訊,Label Studio 的 Community Edition 和 Potato 都能覆蓋。如果研究中多名標註者標註同一批影像並需要報告一致性,Potato 免費提供這些功能。如果只是幾張影像、不想安裝任何東西,VIA 用單個 HTML 檔案就能執行。
有沒有 Labelbox 的開源替代品?
CVAT、Label Studio 的 Community Edition 和 Potato 都是開源且可自行部署的。Labelbox 出售託管平臺和標註人力。開源工具提供的是軟體而不是標註者,所以你需要自己的團隊,或通過 Prolific 這樣的平臺招募。
沒有 GPU 伺服器能用模型輔助分割嗎?
能。Potato 通過 ONNX Runtime Web 在瀏覽器中執行互動式分割和文本提示分割,只要模型權重已經在機器上,就能在斷網環境下使用。它用 SAM 2 做的影片掩碼傳播在伺服器上執行。X-AnyLabeling 在桌面上本地執行模型。CVAT 和 Label Studio 需要呼叫模型伺服器。
如何衡量標註者在邊界框上的一致性?
每張影像至少分給兩名標註者,把他們的框配對,並報告考慮了偶然因素的一致性,因為在大物體上,無論標註者怎麼畫,原始 IoU 都會很高。邊界框一致性指南介紹了配對方法、偶然基線以及應報告的內容。
3D 點雲應該用哪個標註工具?
對於帶序列和軌跡傳播的生產級駕駛資料,請用 Segments.ai、Kognic 或 Supervisely 這樣的專用工具;如果必須開源,就用 CVAT。如果是需要一致性統計的逐幀立方體,或者 3D 只是多模態研究的一部分,Potato 更合適。
延伸閱讀
- AI 標註工具對比,所有資料類型彙總在一頁
- 文本標註工具對比
- 音訊標註工具對比
- 影片標註工具對比
- AI 智慧體評估工具對比
- 世界模型與機器人回合評估工具對比
- 影像標註