Skip to content

비전과 공간 주석

Potato는 이미지, 비디오, 기가픽셀 스캔, 3D 포인트 클라우드, 깊이 맵, 로봇 에피소드에 주석을 달고, 그 모두에 대해 우연 일치를 보정한 일치도를 보고합니다. 비전·공간 영역 개요입니다.

Potato는 이미지, 비디오, 기가픽셀 스캔, 3D 포인트 클라우드, 깊이 맵, 로봇 에피소드, 생성 비디오 롤아웃을 모두 하나의 YAML 설정으로 주석하며, 그 하나하나에 대해 우연 일치를 보정한 일치도를 보고합니다. 이 문서는 지도이고, 각 영역에는 아래에 따로 문서가 있습니다.

이 대부분이 들어온 것이 2.8 버전입니다. 그전의 Potato는 이미지 모드가 붙은 텍스트 주석 플랫폼이었습니다.

여기에 있는 것

영역스키마문서
박스, 폴리곤, 폴리라인, 타원, 직육면체, 키포인트, 마스크image_annotation도형 프리미티브
객체를 클릭해 마스크 얻기sam 도구를 쓰는 image_annotation대화형 분할
어구를 입력해 일치하는 것마다 박스 얻기text_prompt를 쓰는 image_annotation텍스트 프롬프트
클립 전체에서 객체 추적하기video_annotation비디오 추적
기가픽셀 스캔을 전체 해상도로viewer: deepzoom딥 줌
3D 포인트 클라우드와 방향이 있는 직육면체spatial_annotation포인트 클라우드
미터 표시가 있는 깊이 맵depth_map 표시깊이 맵
타임라인 위의 로봇 시연episode_annotation로봇 에피소드
생성 비디오 롤아웃rollout_evaluation세계 모델 평가
참조 표현과 포인팅grounding_eval, region_captionVLM 그라운딩
가져오기 15종과 내보내기 29종CV 형식
어떤 모델을, 어떤 라이선스로모델 주

특이한 부분

여기서 Potato를 구별 짓는 것은 그리기 도구가 아닙니다. CVAT, Label Studio, Roboflow, V7, Supervisely 모두 박스와 폴리곤을 그리고, 그중 몇몇은 더 잘 그립니다. 어디가 그런지는 비교 가이드에 있습니다.

Potato가 더하는 것은 이 영역 하나하나가 우연 일치를 보정한 일치도를 보고한다는 점입니다. 공간 라벨에 대해 우연 일치를 보정한 계수를 보고하는 주석 플랫폼은 다른 곳에서 찾지 못했습니다. 표준은 원시 IoU나 일치 비율인데, 이는 한 답이 우세할 때마다 부풀려지고 거의 언제나 한 답이 우세합니다. 그것이 박스, 마스크, 3D 직육면체, 사건 시점, 캡션에 무엇을 뜻하는지는 측정과 무결성을 보십시오.

모델은 로컬에서 돕니다

대화형 분할과 개방 어휘 텍스트 프롬프트는 둘 다 주석자의 브라우저에서 ONNX Runtime Web을 통해 실행됩니다. 마련할 GPU도, 계속 띄워 둘 모델 서버도, 클릭마다 나가는 네트워크 호출도 없습니다. 가중치가 컴퓨터에 올라오면 전체가 에어갭에서 동작합니다.

비디오 마스크 전파는 예외이며 의도적으로 서버에서 돕니다. 비용이 프롬프트 단위가 아니라 프레임 단위이고, 비디오 모델의 100프레임을 브라우저 탭에서 돌리면 UI가 몇 분 동안 멈추기 때문입니다.

아무것도 번들되지 않고, 요청하지 않으면 아무것도 내려받지 않습니다.

bash
potato download-models --list
potato download-models mobile_sam

모델 주 문서에 각 모델의 라이선스가 적혀 있고, download-models--accept-licence 없이 비상업용 모델을 받아 오기를 거부합니다.

시작하기

가장 빠른 길은 동작하는 예시입니다. 아래 예시는 모두 Potato 저장소에 있으며 저장소 루트에서 내려받기 없이 실행됩니다.

더 읽을거리