Skip to content

视觉与空间标注

Potato 可以标注图像、视频、十亿像素扫描件、三维点云、深度图与机器人回合,并对上述全部内容报告经机遇校正的一致性。本节概述视觉与空间相关的能力。

Potato 用一份 YAML 配置即可标注图像、视频、十亿像素扫描件、三维点云、深度图、机器人回合以及生成式视频推演,并对其中每一项报告经机遇校正的一致性。 本页是索引,每一类能力在下文都有自己的页面。

这些能力大多是在 2.8 版本中到位的。在此之前,Potato 是一个带有图像模式的文本标注平台。

这里有什么

能力模式页面
框、多边形、折线、椭圆、立方体、关键点、掩码image_annotation几何图元
点击一个对象,得到一份掩码sam 工具的 image_annotation交互式分割
输入一个短语,所有匹配项自动框出text_promptimage_annotation文本提示
在一段视频中跟踪一个对象video_annotation视频跟踪
以全分辨率查看十亿像素扫描件viewer: deepzoom深度缩放
三维点云与带朝向的立方体spatial_annotation点云
带米制读数的深度图depth_map 显示类型深度图
时间轴上的机器人演示episode_annotation机器人回合
生成式视频推演rollout_evaluation世界模型评估
指代表达式与指点grounding_evalregion_captionVLM 定位
15 种导入格式与 29 种导出格式CV 格式
有哪些模型,各自适用什么许可模型库

真正不同寻常的地方

在这里,绘图工具并不是 Potato 的区别所在。CVAT、Label Studio、Roboflow、V7 与 Supervisely 都能画框和多边形,其中几家做得还更好;工具对比指南说明了具体在哪些方面。

Potato 额外提供的,是上述每一类能力都会报告经机遇校正的一致性。我们没有找到任何其他标注平台会为空间标签报告经机遇校正的系数:通行做法是原始 IoU 或百分比匹配,而只要某一个答案占据主导,这类数字就会被抬高,且几乎总有一个答案占据主导。关于这对框、掩码、三维立方体、事件时点与区域描述分别意味着什么,参见测量与完整性

模型在本地运行

交互式分割与开放词表文本提示都通过 ONNX Runtime Web 在标注者的浏览器中运行。无需配置 GPU,无需维护模型服务,每次点击也不产生网络调用。一旦权重就位于本机,整套流程即可在气隙环境下工作。

视频掩码传播是例外,它运行在服务端,而且是有意如此:它的开销按帧计而非按提示计,在浏览器标签页中跑上一百帧视频模型,意味着界面要冻结好几分钟。

任何模型都不随包捆绑,你不主动要求就不会下载:

bash
potato download-models --list
potato download-models mobile_sam

模型库页面列出了每个模型的许可,并且在缺少 --accept-licence 时,download-models 会拒绝拉取非商业用途的模型。

从哪里开始

最快的路径是跑一个可运行示例。以下示例都位于 Potato 仓库中,在仓库根目录下即可运行,无需任何下载:

延伸阅读