Skip to content

視覺與空間標註

Potato 可以標註影像、影片、十億畫素掃描件、三維點雲、深度圖與機器人回合,並對上述全部內容報告經機遇校正的一致性。本節概述視覺與空間相關的能力。

Potato 用一份 YAML 配置即可標註影像、影片、十億畫素掃描件、三維點雲、深度圖、機器人回合以及生成式影片推演,並對其中每一項報告經機遇校正的一致性。 本頁是索引,每一類能力在下文都有自己的頁面。

這些能力大多是在 2.8 版本中到位的。在此之前,Potato 是一個帶有影像模式的文本標註平臺。

這裡有什麼

能力模式頁面
框、多邊形、折線、橢圓、立方體、關鍵點、掩碼image_annotation幾何圖元
點選一個物件,得到一份掩碼sam 工具的 image_annotation互動式分割
輸入一個短語,所有匹配項自動框出text_promptimage_annotation文本提示
在一段影片中跟蹤一個物件video_annotation影片跟蹤
以全解析度檢視十億畫素掃描件viewer: deepzoom深度縮放
三維點雲與帶朝向的立方體spatial_annotation點雲
帶米制讀數的深度圖depth_map 顯示類型深度圖
時間軸上的機器人演示episode_annotation機器人回合
生成式影片推演rollout_evaluation世界模型評估
指代表達式與指點grounding_evalregion_captionVLM 定位
20 種匯入格式與 31 種匯出格式CV 格式
有哪些模型,各自適用什麼許可模型庫

真正不同尋常的地方

在這裡,繪圖工具並不是 Potato 的區別所在。CVAT、Label Studio、Roboflow、V7 與 Supervisely 都能畫框和多邊形,其中幾家做得還更好;工具對比指南說明了具體在哪些方面。

Potato 額外提供的,是上述每一類能力都會報告經機遇校正的一致性。我們沒有找到任何其他標註平臺會為空間標籤報告經機遇校正的係數:通行做法是原始 IoU 或百分比匹配,而只要某一個答案佔據主導,這類數字就會被抬高,且幾乎總有一個答案佔據主導。關於這對框、掩碼、三維立方體、事件時點與區域描述分別意味著什麼,參見測量與完整性

模型在本地執行

互動式分割與開放詞表文本提示都通過 ONNX Runtime Web 在標註者的瀏覽器中執行。無需配置 GPU,無需維護模型服務,每次點選也不產生網路呼叫。一旦權重就位於本機,整套流程即可在氣隙環境下工作。

影片掩碼傳播是例外,它執行在服務端,而且是有意如此:它的開銷按幀計而非按提示計,在瀏覽器標籤頁中跑上一百幀影片模型,意味著介面要凍結好幾分鐘。

任何模型都不隨包捆綁,你不主動要求就不會下載:

bash
potato download-models --list
potato download-models mobile_sam

模型庫頁面列出了每個模型的許可,並且在缺少 --accept-licence 時,download-models 會拒絕拉取非商業用途的模型。

從哪裡開始

最快的路徑是跑一個可執行示例。以下示例都位於 Potato 倉庫中,在倉庫根目錄下即可執行,無需任何下載:

延伸閱讀