视觉与空间标注
Potato 可以标注图像、视频、十亿像素扫描件、三维点云、深度图与机器人回合,并对上述全部内容报告经机遇校正的一致性。本节概述视觉与空间相关的能力。
Potato 用一份 YAML 配置即可标注图像、视频、十亿像素扫描件、三维点云、深度图、机器人回合以及生成式视频推演,并对其中每一项报告经机遇校正的一致性。 本页是索引,每一类能力在下文都有自己的页面。
这些能力大多是在 2.8 版本中到位的。在此之前,Potato 是一个带有图像模式的文本标注平台。
这里有什么
| 能力 | 模式 | 页面 |
|---|---|---|
| 框、多边形、折线、椭圆、立方体、关键点、掩码 | image_annotation | 几何图元 |
| 点击一个对象,得到一份掩码 | 带 sam 工具的 image_annotation | 交互式分割 |
| 输入一个短语,所有匹配项自动框出 | 带 text_prompt 的 image_annotation | 文本提示 |
| 在一段视频中跟踪一个对象 | video_annotation | 视频跟踪 |
| 以全分辨率查看十亿像素扫描件 | viewer: deepzoom | 深度缩放 |
| 三维点云与带朝向的立方体 | spatial_annotation | 点云 |
| 带米制读数的深度图 | depth_map 显示类型 | 深度图 |
| 时间轴上的机器人演示 | episode_annotation | 机器人回合 |
| 生成式视频推演 | rollout_evaluation | 世界模型评估 |
| 指代表达式与指点 | grounding_eval、region_caption | VLM 定位 |
| 15 种导入格式与 29 种导出格式 | — | CV 格式 |
| 有哪些模型,各自适用什么许可 | — | 模型库 |
真正不同寻常的地方
在这里,绘图工具并不是 Potato 的区别所在。CVAT、Label Studio、Roboflow、V7 与 Supervisely 都能画框和多边形,其中几家做得还更好;工具对比指南说明了具体在哪些方面。
Potato 额外提供的,是上述每一类能力都会报告经机遇校正的一致性。我们没有找到任何其他标注平台会为空间标签报告经机遇校正的系数:通行做法是原始 IoU 或百分比匹配,而只要某一个答案占据主导,这类数字就会被抬高,且几乎总有一个答案占据主导。关于这对框、掩码、三维立方体、事件时点与区域描述分别意味着什么,参见测量与完整性。
模型在本地运行
交互式分割与开放词表文本提示都通过 ONNX Runtime Web 在标注者的浏览器中运行。无需配置 GPU,无需维护模型服务,每次点击也不产生网络调用。一旦权重就位于本机,整套流程即可在气隙环境下工作。
视频掩码传播是例外,它运行在服务端,而且是有意如此:它的开销按帧计而非按提示计,在浏览器标签页中跑上一百帧视频模型,意味着界面要冻结好几分钟。
任何模型都不随包捆绑,你不主动要求就不会下载:
potato download-models --list
potato download-models mobile_sam模型库页面列出了每个模型的许可,并且在缺少 --accept-licence 时,download-models 会拒绝拉取非商业用途的模型。
从哪里开始
最快的路径是跑一个可运行示例。以下示例都位于 Potato 仓库中,在仓库根目录下即可运行,无需任何下载:
examples/image/interactive-segmentation/——点击即分割examples/image/text-prompt-labeling/——输入短语并据此标注examples/video/mask-propagation/——跨越遮挡进行跟踪examples/spatial/kitti-cuboids/——在激光雷达数据上画三维框examples/embodied/lerobot-episode/——一段机器人演示
延伸阅读
- 测量与完整性——几何、时间与三维上的一致性
- 图像标注参考
- 视频标注参考
- 2.8 版本发布说明