Skip to content

图像标注工具对比:CVAT、Label Studio、Roboflow、V7 与 Potato

从边界框、分割、关键点、十亿像素图像和 3D 点云几个方面对比 CVAT、Label Studio、Roboflow、V7、Supervisely、Segments.ai、X-AnyLabeling、VIA 与 Potato。

大规模计算机视觉标注,CVAT 是参考级的开源工具;Roboflow、V7 和 Supervisely 作为商业产品,额外提供模型训练或托管的工作流。当图像标签是研究数据时,Potato 更合适:多名标注者标注同一批图像,研究需要报告他们的一致程度。当图像与文本、音频或模型输出出现在同一项研究中时,它也合适。

边界框是围住物体的矩形。图像分割把像素分配给物体,形式可以是多边形或掩码。关键点标出关节之类的标志点,骨架把它们连起来。交并比(IoU)衡量两个形状的重叠程度,大多数工具用它来比较标注者。

本页讨论图像、十亿像素切片和 3D 点云。所有数据类型放在一页里的对比见 AI 标注工具对比

哪些图像标注工具值得比较?

工具运行方式费用适合
Potato自行部署(GPL-3.0)免费需要报告一致性的多标注者研究
CVAT自行部署(MIT)或托管免费;托管版每用户每月 33 美元大批量的边界框、掩码和视频跟踪
Label Studio自行部署或托管Community Edition 免费;付费方案每月 99 美元起同时标注文本、音频或视频的项目中的图像
Roboflow托管商业从标签一路做到训练并部署检测器
V7托管商业托管工作流、医学影像格式、模型辅助标注
Supervisely自行部署或托管Community Edition;另有商业版本大图像、3D,以及在同一产品中训练模型
Segments.ai托管商业3D 点云与传感器融合
X-AnyLabeling桌面应用免费一个人在本地用多种模型标注
VIA单个 HTML 文件,在浏览器中离线运行免费(BSD-2-Clause)不装任何东西的小项目

边界框、多边形和关键点

这里的每个工具都能画边界框和多边形。CVAT、Label Studio、Roboflow、V7、Supervisely、Segments.ai 和 Potato 还支持带骨架的关键点。Potato 另外提供折线、椭圆、2D 立方体,以及按实例区分的画笔掩码。

成熟的计算机视觉平台可以给每个物体附加属性,例如遮挡程度、截断标记或子类型。Potato 目前还不支持。在 Potato 中,几何形状只带一个标签,其他属性需要配合一个额外的方案。

借助模型进行分割

交互式分割把一次点击或一个粗略轮廓变成贴合的掩码。Potato 在浏览器里运行它,不需要准备 GPU。CVAT 通过 Nuclio 函数或其 AI 智能体途径实现,Label Studio 通过 ML 后端实现。Roboflow、V7、Supervisely 和 Segments.ai 把它内置在产品中。

文本提示分割会为你说出名字的物体返回掩码。Potato 用一个 Apache-2.0 许可的模型在浏览器中运行它。Roboflow 和 V7 在自己的服务器上使用 SAM 3,Supervisely 通过应用提供,Label Studio 通过 ML 后端提供。X-AnyLabeling 把 Grounding DINO、Grounded-SAM 2、SAM 2.1 和 YOLO 打包进一个桌面应用,对于一个人在本地用多种模型标注的情况,很难找到更好的选择。Potato 的优势在标注者多于一人时才开始显现。

如何标注图像分割掩码输入名称来标注物体

十亿像素图像与病理切片

Potato 构建瓦片金字塔,同时以 DZI 和 IIIF Image API 3.0 提供。画笔掩码在源图像的全分辨率下工作,因为掩码缓冲区索引的是图像像素而不是 GPU 纹理,所以没有纹理尺寸上限。16 位科学 TIFF 会使用百分位窗口,让暗淡的结构仍然可见。V7 和 Supervisely 也能处理超大图像,CVAT 部分支持。见基于深度缩放的十亿像素图像标注

数字病理方面,QuPath(开源桌面应用,该领域的标准)和 Cytomine(开源网页应用,支持多用户盲标)是专门为此打造的。Potato 不读取 SVS、DICOM 或 NIfTI。

3D 点云

Potato 用 3D 立方体、点、折线和逐点分段来标注 PCD、PLY、LAS、KITTI .bin.xyz 点云。立方体的旋转以四元数存储,因此俯仰和横滚在往返转换中不会丢失;立方体之间用精确的旋转 3D IoU 来比较。标注按帧进行。

Segments.aiKognicDeepen AISuperviselyXtreme1/BasicAI 是专用工具,在自动驾驶生产流水线上领先:带轨迹传播的序列工作流、雷达和多激光雷达支持,以及自动拟合的立方体。CVAT、Supervisely 和 Segments.ai 能处理点云序列,Potato 不能。见如何标注 3D 点云

衡量图像标签的一致性

大多数计算机视觉工具按重叠来比较标注者。CVAT 的共识引擎和 V7 的共识阶段,都是用原始 IoU 对照每个类别的阈值来比较标注者;Label Studio Enterprise 列出的指标是精确匹配、数值差、IoU 和片段重叠。这些方法都不校正偶然一致,而且在大物体上,两个框即使都画得很随意,IoU 也会很高。

Potato 报告几何形状上的一致性,并附带经验性的偶然基线。我们没有找到其他在空间标签上报告经偶然校正的一致性的标注平台。方法见如何衡量边界框上的标注者间一致性

预标注还带来第二个问题。不加检查就接受模型建议的标注者,会把各项一致性数字都抬高,同时降低准确性。Potato 记录绘制时的时间信息,据此可以区分经过审阅的建议和直接放行的建议。见识别未经审阅就接受的预标注

格式

Potato 能导入 15 种计算机视觉格式,其中 11 种可以往返转换。它可以导出 COCO、YOLO、Pascal VOC、CVAT、LabelMe、Cityscapes、KITTI、V7 Darwin、PNG 掩码、MOT 和 DAVIS。见计算机视觉格式

每张图像两名标注者的边界框任务

yaml
agreement_metrics:
  enabled: true
 
annotation_schemes:
  - annotation_type: image_annotation
    name: objects
    description: "Draw a tight box around every vehicle."
    source_field: image
    tools: [bbox]
    labels:
      - {name: car, color: "#FF6B6B"}
      - {name: truck, color: "#4ECDC4"}
 
num_annotators_per_item:
  default: 2

每张图像分给两名标注者,管理后台会报告他们在边界框上的一致性。

Potato 在图像上不做的事

  • 不训练模型。 Potato 用现有模型做预标注,但不训练检测器。Roboflow、V7、Supervisely 和 Labelbox 可以。
  • 暂不支持逐物体属性。
  • 不支持点云序列。 3D 标注按帧进行。
  • 不支持 DICOM、NIfTI 或全切片格式。
  • 不提供托管的标注人员。 请自带标注者,或在 Prolific 上招募。

以上内容于 2026 年 8 月和 9 月对照各项目的文档和价格页核实。

常见问题

最好的免费图像标注工具是哪个?

如果是只有计算机视觉的大批量工作,CVAT 免费、成熟且可自行部署。如果图像所在的项目还要标注文本或音频,Label Studio 的 Community Edition 和 Potato 都能覆盖。如果研究中多名标注者标注同一批图像并需要报告一致性,Potato 免费提供这些功能。如果只是几张图像、不想安装任何东西,VIA 用单个 HTML 文件就能运行。

有没有 Labelbox 的开源替代品?

CVAT、Label Studio 的 Community Edition 和 Potato 都是开源且可自行部署的。Labelbox 出售托管平台和标注人力。开源工具提供的是软件而不是标注者,所以你需要自己的团队,或通过 Prolific 这样的平台招募。

没有 GPU 服务器能用模型辅助分割吗?

能。Potato 通过 ONNX Runtime Web 在浏览器中运行交互式分割和文本提示分割,只要模型权重已经在机器上,就能在断网环境下使用。它用 SAM 2 做的视频掩码传播在服务器上运行。X-AnyLabeling 在桌面上本地运行模型。CVAT 和 Label Studio 需要调用模型服务器。

如何衡量标注者在边界框上的一致性?

每张图像至少分给两名标注者,把他们的框配对,并报告考虑了偶然因素的一致性,因为在大物体上,无论标注者怎么画,原始 IoU 都会很高。边界框一致性指南介绍了配对方法、偶然基线以及应报告的内容。

3D 点云应该用哪个标注工具?

对于带序列和轨迹传播的生产级驾驶数据,请用 Segments.ai、Kognic 或 Supervisely 这样的专用工具;如果必须开源,就用 CVAT。如果是需要一致性统计的逐帧立方体,或者 3D 只是多模态研究的一部分,Potato 更合适。

延伸阅读