Skip to content

AI 标注工具对比:开源与付费

对比 14 款标注工具与平台,涵盖文本、视觉、3D 与智能体评估:哪些支持 AI 预标注,各自的免费版本实际包含什么。

标注工具是把标签附加到文本、图像、音频、视频或模型输出上的软件,使结果可以用来训练或评测系统。本指南从模态覆盖、AI 辅助标注、一致性指标,以及各家免费版本实际包含的内容出发,对比 14 款开源和商业工具。

没有唯一的最佳工具。正确的选择取决于你要标注什么、预算多少、是否需要评测智能体或 LLM,以及你能接受多少配置工作。

我该对比哪些标注工具?

工具许可优势适用场景
Potato免费、开源(研究用途)跨文本/图像/音频/视频/3D/机器人的 61 种任务类型、智能体与 LLM 评测、零代码 YAML、内置一致性指标研究、智能体/LLM 评测、无需写代码的快速搭建
Label Studio开源 + 付费层级广泛的模态支持、精致的界面、庞大的生态想要有商业支持平台的团队
Prodigy付费(商业)可脚本化、以主动学习为先、与 spaCy 紧密集成习惯使用付费、以代码驱动工具的 spaCy 用户
Doccano开源简洁、清爽、易于自托管直接的文本分类与命名实体识别
brat开源成熟的富文本/关系标注实体与关系的语言学标注
INCEpTION开源丰富的语言学标注、知识库链接能在配置上投入精力的深度语言学项目
Argilla开源聚焦 LLM 数据、与 Hugging Face 集成在 HF 技术栈中收集反馈/RLHF 数据
CVAT开源图像/视频计算机视觉标注边界框、掩码以及视频 CV 标注
Labelbox / Scale商业(付费)托管平台、大规模标注人力服务既购买工具又购买标注人力的企业

(这些细节会随时间变化,请查阅各项目以获取当前的许可与功能信息。)

许可证那一栏藏了一件事:免费版里究竟包含什么。Label Studio 的社区版根本没有任何标注者间一致性指标,标准答案标记和质量看板要从每用户每月 99 美元起。Prodigy 没有免费版。CVAT 把质量控制界面列为付费功能。如果你是按质量控制而不是按模态覆盖来选工具,那就去比免费版,而不是比营销页面。我们维护了一份十一款工具的能力对照表,逐条核对过它们各自的文档。

哪些标注工具会用 AI 预标注?

"AI 标注工具"这个说法涵盖三种能力,它们通常被当作一件事来卖,而具备其中一种的工具往往缺少另外两种。

  • 模型辅助的几何标注。 粗略点击或绘制,分割模型会把边界收紧。Potato 在浏览器中运行这一步,不需要 GPU;CVAT 通过 Nuclio 或其 AI agent 路径实现;Label Studio 通过 ML 后端实现;Roboflow、V7、Supervisely 和 Segments.ai 则内置于产品之中。
  • 基于提示词的标注。 输入物体名称即可得到掩码或框,而不必从固定列表中挑选。Potato、Roboflow 和 V7 支持这种方式。参见通过输入名称标注物体
  • LLM 与 VLM 预标注。 由模型为整批数据提出标签,再由标注者复核。Potato 为此提供 13 种端点类型,还可以让视觉语言模型对完成的标注提出批评。

预标注改变了质量控制需要抓住的问题。不阅读就直接接受建议的标注者会抬高所有一致性数字,同时降低准确率,而计时是唯一能区分认真复核与走过场的信号。参见识别走过场的预标注

Potato 不训练也不部署模型。它负责排列条目、调用你指定的模型,并记录标注者对结果做了什么。

视觉、3D 与模型评测

Potato 在计算机视觉、空间和评测方面的功能比它的文本功能更新。下面这张表记录的是各款工具强在哪里,而不是给它们排名次。

能力PotatoCVATLabel StudioRoboflowV7SuperviselySegments.ai
免费自托管是(MIT)社区版--社区版-
边界框、多边形、掩码
交互式分割浏览器内,无需 GPU通过 Nuclio通过 ML 后端
文本提示分割是(浏览器内)-通过 ML 后端是(SAM 3)是(SAM 3)通过应用-
关键点/骨架
折线、椭圆、2D 立方体部分部分
按对象的属性-
带插值的视频跟踪部分部分
基于模型的掩码传播是(SAM 2,服务端)通过 AI 智能体通过 ML 后端
深度缩放/千兆像素是(DZI + IIIF)部分---
3D 点云与立方体---
点云序列----
传感器融合(2D↔3D)部分---
带窗宽窗位的深度图---部分--
DICOM / NIfTI / WSI-----
在同一产品内训练模型-部分--
CV 格式导入15 种格式广泛部分广泛部分广泛部分
对几何标注的机遇校正一致性------
机器人回合(LeRobot、RLDS、HDF5)------
生成视频/世界模型评测------
VLM 定位与指点评测------

在大多数行上,成熟的 CV 平台与 Potato 持平或胜过它。有两行值得细读,而不是只看有没有打勾:Potato 的文本提示分割在浏览器内运行,用的是 Apache-2.0 许可的模型,而商业同类功能是在服务端运行、受 SAM 3 的非商用条款约束;它的掩码传播跑在服务端,所以免费版能用上这项能力,只是不在浏览器内。在最后四行上,Potato 做的是其他工具并不提供的事情。

大批量的计算机视觉

CVAT 是开源 CV 工具的参照标准,对于只做 CV 的大批量流水线仍是更好的选择:任务与作业管理更细致、支持按对象的属性、通过 Datumaro 接入的格式生态更大,社区也非常庞大。当 CV 工作要与文本、音频或评测任务并行,或者你需要的是标注者之间的一致性而不是与标准答案作业比对的准确率时,选 Potato。

如果你的目标是拿到一个训练好的模型,Roboflow 非常出色:Smart Polygon、批量自动标注、用你自己的模型做 Label Assist,以及托管的训练与部署都在同一个闭环里。Potato 不训练检测器。当标注本身就是研究成果、并且其可靠性需要站得住脚时,选 Potato。

Labelbox、SuperAnnotate、Encord、Kili 与 V7 是成熟的商业平台,具备人力管理、企业级治理和强大的模型辅助标注。如果你需要托管的标注人力、合规认证,或者 PB 级的数据策展,它们就是正确答案。

X-AnyLabeling 把 Grounding DINO、Grounded-SAM 2、SAM 2.1 和 YOLO 打包进一个桌面应用,对于一个人在本地用大量模型做标注,很难有更好的选择。Potato 自带的模型集更窄,并且跑在浏览器里,标注者的机器上什么都不用装;它的优势要从标注者不止一个人时才开始显现。

千兆像素与数字病理

Potato 会构建一个瓦片金字塔,并同时以 DZI 和 IIIF Image API 3.0 提供服务;由于掩码缓冲区索引的是图像像素而不是 GPU 纹理,画笔掩码可以在源图的完整分辨率下工作。

具体到数字病理,QuPath(桌面端、开源、该领域的事实标准)和 Cytomine(网页端、开源、支持盲标的多用户)都是为此专门打造的,而 Potato 读不了 SVS、DICOM 或 NIfTI。当你的图像很大但不是临床格式,或者你需要在其上叠加 Potato 的一致性与工作流层时,就用 Potato。

3D 与传感器融合

Segments.aiKognicDeepen AISuperviselyXtreme1/BasicAI 都是专业工具,在生产级自动驾驶流水线上它们更领先:带轨迹传播的序列与回合工作流、雷达与多 LiDAR 支持、自动拟合立方体的模型、按对象的属性本体,以及 Deepen 那一套完整的无靶标定产品。Supervisely 和 Xtreme1 都可自托管,其中 Supervisely 能处理大得多的点云。

如果你想要空间标注上的可靠性统计,或者 3D 只是一项多模态研究中的一部分,3D 就选 Potato。

机器人、世界模型与定位

对于机器人回合ATLAS(维也纳工业大学)是一款专注于长时程动作分割的桌面工具,原生支持 ROS bag 与 RLDS,为单标注者的边界精度而生。ELANBORIS 仍是行为编码的标准,RerunFoxglove 则是最好的机器人可视化工具。

对于生成视频,这个生态主要由基准构成(VBench、WorldModelBench、Physics-IQ),再加上用于大规模偏好收集的众包评审团。它们提供指标和参照协议;Potato 提供的是一件仪器,用来反复开展人类一侧的评测并测量其可靠性,两者是互补而非竞争关系。

对于VLM 定位,这个领域是由数据集和评测框架(RefCOCO、PixMo-Points、PointBench、lmms-eval、VLMEvalKit)而不是由标注产品定义的。Potato 的角色是收集并测量这些基准所依赖的人工标准答案。

Potato 不做什么

免得在评估的后期才发现这些:

  • 不训练模型。 Potato 会对条目排序、用已有模型做预标注,并用 VLM 对标注提出意见。它不训练也不部署检测器。Roboflow、V7、Supervisely 和 Labelbox 会。
  • 暂无按对象的属性。 一个几何形状携带一个标签;遮挡程度、截断标志和子类型属性需要另配一套 schema。
  • 没有点云序列模式。 3D 标注是逐帧进行的,尚未实现跨一整段扫描的轨迹传播。
  • 不支持 DICOM、NIfTI 或 WSI。 深度缩放和 16 位窗宽窗位覆盖的是大幅科研图像,而不是临床图像。
  • 没有托管人力、SAML/SCIM 或合规认证。 Potato 是你自己运行的软件。它支持 RBAC 和 OAuth,但不提供企业级治理。

功能数量

类别Potato
标注 schema61
显示类型24
导出格式29
导入格式15
AI/LLM 端点类型13
数据源类型8
分配策略11
问卷量表55
众包集成9
工作流阶段8

这些数字由 Potato 自己的注册表生成。这里没有「最佳替代品」那一列,因为上面这些工具组织能力的方式差别足够大,用单一数字来比反而会误导。

我该如何选择标注工具?

  • 你要标注什么? 对于纯文本的命名实体识别,Doccano 或 brat 都很简单。对于文本/图像/音频/视频的混合内容,Potato 和 Label Studio 覆盖范围更广。
  • 你是否需要智能体或 LLM 评测? 这正是 Potato 的与众不同之处:它能读取多种格式的智能体轨迹,并为轨迹过程奖励网页智能体编码智能体多智能体团队computer-use/多模态评测提供了专门构建的工具。多数通用工具并不具备这些功能。
  • 预算。 Potato、Label Studio(核心版)、Doccano、brat 与 Argilla 均为免费开源;Prodigy 以及 Label Studio 的部分层级则需付费。
  • 配置工作量。 Potato 用一个 YAML 文件进行配置,无需写代码;Prodigy 以代码为先;其余几款介于两者之间。
  • 生态。 Prodigy 与 spaCy 搭配;Argilla 与 Hugging Face 搭配;Potato 可导出到多种 ML 格式,包括 CoNLL、spaCy、Hugging Face 以及 COCO/YOLO。

Potato 在什么时候是合适的标注工具?

Potato 源自学术界的 NLP。最初的系统在 EMNLP 2022 上发表,Potato 2.0 则发表于 ACL 2026,它为完整的研究工作流而设计:众多任务类型、开箱即用的质量控制与一致性指标、众包集成,以及一整套AI 智能体评测工具。如果你的工作横跨多个模态,或者包含对 LLM 和智能体的评测,它值得一试。

如果你主要只需要单一文本任务并使用托管的商业产品,或者你完全生活在 spaCy 或 Hugging Face 之中,那么其中另一款可能更适合你。

常见问题

最好的免费标注工具是哪个?

这取决于模态。纯文本的分类和 NER,Doccano 和 brat 上手成本最低。若一个项目中同时有文本、图像、音频和视频,Potato 和 Label Studio 的社区版都能覆盖,差别体现在质量控制上:Potato 免费提供一致性指标和质量看板,而 Label Studio 把它们放在付费层。大批量的计算机视觉,CVAT 免费且成熟。

Potato 是 Label Studio 的免费替代品吗?

是的。Potato 免费且开源,用一份 YAML 配置、无需写代码,就能覆盖文本、图像、音频、视频以及智能体/LLM 评测。Label Studio 在某些集成上更宽泛,但会把团队推向付费层级;Potato 始终免费且可自托管,这与学术研究和可复现研究的工作很契合。

Potato 是 Prodigy 的免费开源替代品吗?

是的。Prodigy 是一款出色的付费、以代码为先、并与 spaCy 紧密绑定的工具;Potato 免费,用 YAML 配置、无需写代码,并可导出为 spaCy、CoNLL 和 Hugging Face 格式。如果你想要无需商业许可的主动学习,Potato 就是那个开源选项。

在语言学标注方面,Potato 与 INCEpTION 相比如何?

INCEpTION 在深度语言学标注和知识库链接方面很强大,但部署起来更重。Potato 上手更简单,一个 YAML 文件加一条命令即可,对于不需要 INCEpTION 全套语言学机制的跨度、关系和分类任务,通常更快。

为什么用 Potato 而不是 Labelbox 或 Scale AI 这类商业平台?

Labelbox 和 Scale 出售托管平台和标注人力,这适合两者一起购买的企业。对于自带标注者、并需要数据留在自己服务器上的研究团队,Potato 是那个免费、可自托管的替代品,且内置标注者间一致性指标。

标注 AI 智能体轨迹的最佳开源工具是什么?

这正是 Potato 在通用标注工具中与众不同之处:它能读取 15 种格式的智能体轨迹,并为轨迹步骤级网页智能体编码智能体评测提供了专门构建的显示界面。多数工具,无论开源还是商业,根本不标注智能体运行。它还能在可点击的交互图上标注多智能体团队,以及标注 computer-use 和语音智能体等多模态智能体

Potato 能评测哪些可观测性工具和标注平台无法评测的内容?

有两类智能体标注界面,在那些常被拿来与 Potato 比较的工具(LangSmith、Langfuse、Labelbox、Scale AI、Label Studio、Argilla、Braintrust)中,都没有作为可配置、可自托管的功能出现,以上结论依据这些工具截至 2026 年 6 月的文档核对:

  • 多智能体团队结构。 一张可由标注者编辑的交互图(标出关键路径、标记糟糕的交接)、以「责任智能体/决定性步骤/原因」三元组形式呈现的跨智能体失败归因、作为一等对象的交接审查、按智能体和按团队的评分卡、工具争用时间线,以及涌现行为标签。其他工具中最接近的是 Langfuse 的 "Agent Graphs",但那只是一个只读的调试视图,而非标注界面。
  • 多模态智能体。 带有点击定位标记的 computer-use 轨迹、带有插话打断(barge-in)评分的全双工语音时间线,以及对模型预测区间进行实时 IoU 计算的视频时序定位。Scale AI 也做 GUI 定位和语音评测,但都是以托管数据集业务的形式提供,而且其语音竞技场是按轮次进行,而非全双工。

可观测性工具(LangSmith、Langfuse、Braintrust)会附加跨度级(span-level)的评分和评论,这确实是真正的按步骤标注,但并非上述这些智能体结构界面。标注平台(Labelbox、Scale)提供智能体评测数据产品,但都是付费云服务或托管服务,而不是你能自托管并用 YAML 配置的工具。各项能力变化很快,因此这反映的是 2026 年 6 月的一个快照;完整对比文章列出了所核对的版本。

延伸阅读