視覺與空間標註
Potato 可以標註影像、影片、十億畫素掃描件、三維點雲、深度圖與機器人回合,並對上述全部內容報告經機遇校正的一致性。本節概述視覺與空間相關的能力。
Potato 用一份 YAML 配置即可標註影像、影片、十億畫素掃描件、三維點雲、深度圖、機器人回合以及生成式影片推演,並對其中每一項報告經機遇校正的一致性。 本頁是索引,每一類能力在下文都有自己的頁面。
這些能力大多是在 2.8 版本中到位的。在此之前,Potato 是一個帶有影像模式的文本標註平臺。
這裡有什麼
| 能力 | 模式 | 頁面 |
|---|---|---|
| 框、多邊形、折線、橢圓、立方體、關鍵點、掩碼 | image_annotation | 幾何圖元 |
| 點選一個物件,得到一份掩碼 | 帶 sam 工具的 image_annotation | 互動式分割 |
| 輸入一個短語,所有匹配項自動框出 | 帶 text_prompt 的 image_annotation | 文本提示 |
| 在一段影片中跟蹤一個物件 | video_annotation | 影片跟蹤 |
| 以全解析度檢視十億畫素掃描件 | viewer: deepzoom | 深度縮放 |
| 三維點雲與帶朝向的立方體 | spatial_annotation | 點雲 |
| 帶米制讀數的深度圖 | depth_map 顯示類型 | 深度圖 |
| 時間軸上的機器人演示 | episode_annotation | 機器人回合 |
| 生成式影片推演 | rollout_evaluation | 世界模型評估 |
| 指代表達式與指點 | grounding_eval、region_caption | VLM 定位 |
| 20 種匯入格式與 31 種匯出格式 | — | CV 格式 |
| 有哪些模型,各自適用什麼許可 | — | 模型庫 |
真正不同尋常的地方
在這裡,繪圖工具並不是 Potato 的區別所在。CVAT、Label Studio、Roboflow、V7 與 Supervisely 都能畫框和多邊形,其中幾家做得還更好;工具對比指南說明了具體在哪些方面。
Potato 額外提供的,是上述每一類能力都會報告經機遇校正的一致性。我們沒有找到任何其他標註平臺會為空間標籤報告經機遇校正的係數:通行做法是原始 IoU 或百分比匹配,而只要某一個答案佔據主導,這類數字就會被抬高,且幾乎總有一個答案佔據主導。關於這對框、掩碼、三維立方體、事件時點與區域描述分別意味著什麼,參見測量與完整性。
模型在本地執行
互動式分割與開放詞表文本提示都通過 ONNX Runtime Web 在標註者的瀏覽器中執行。無需配置 GPU,無需維護模型服務,每次點選也不產生網路呼叫。一旦權重就位於本機,整套流程即可在氣隙環境下工作。
影片掩碼傳播是例外,它執行在服務端,而且是有意如此:它的開銷按幀計而非按提示計,在瀏覽器標籤頁中跑上一百幀影片模型,意味著介面要凍結好幾分鐘。
任何模型都不隨包捆綁,你不主動要求就不會下載:
potato download-models --list
potato download-models mobile_sam模型庫頁面列出了每個模型的許可,並且在缺少 --accept-licence 時,download-models 會拒絕拉取非商業用途的模型。
從哪裡開始
最快的路徑是跑一個可執行示例。以下示例都位於 Potato 倉庫中,在倉庫根目錄下即可執行,無需任何下載:
examples/image/interactive-segmentation/——點選即分割examples/image/text-prompt-labeling/——輸入短語並據此標註examples/video/mask-propagation/——跨越遮擋進行跟蹤examples/spatial/kitti-cuboids/——在雷射雷達資料上畫三維框examples/embodied/lerobot-episode/——一段機器人演示
延伸閱讀
- 測量與完整性——幾何、時間與三維上的一致性
- 影像標註參考
- 影片標註參考
- 2.8 版本釋出說明