Skip to content

측정과 무결성

Potato는 도형, 시간, 3D 직육면체, 캡션, 세계 모델 붕괴 지점에 대해 우연 일치를 보정한 일치도를 보고하며, 주석이 어떻게 만들어졌는지도 기록합니다. 측정 기능 개요.

Potato의 모든 주석 유형에는 주석자들이 서로 일치하는지를 우연 일치 보정을 거쳐 측정하는 수단이 함께 제공되며, 그 방법이 무너지는 조건도 명시되어 있습니다. 여기에는 공간 유형과 시간 유형도 포함됩니다. 이 분야의 업계 표준은 원시 IoU나 일치율인데, 둘 다 우연 일치를 보정하지 않습니다.

이 섹션은 질문의 양쪽 측면을 모두 다룹니다. 라벨이 일치하는지, 그리고 그것이 어떻게 만들어졌는지입니다.

전체를 관통하는 구조

질문측도
주석자들이 같은 대상을 찾았는가검출 α
같은 이름으로 불렀는가분류 α
같은 위치에 두었는가경험적 우연 기준선 대비 σ와 KS
어느 마스크를 신뢰할 것인가STAPLE
이벤트 시작 시점에 대해 일치하는가시간 IoU와 경계 α
3D 박스에 대해 일치하는가정확한 회전 3D IoU
같은 영역을 같은 방식으로 기술하는가텍스트 상의 의미 거리를 사용한 α
세계가 무너진 시점에 대해 일치하는가허용 오차 스윕을 적용한 붕괴 지점 일치도
그 주석자는 유능한가진정으로 범주형인 부분에 대해서는 MACE

왜 우연 일치 보정이 필요한가

원시 일치도는 하나의 답이 지배적일 때 반드시 부풀려집니다. 그리고 대개는 하나의 답이 지배적입니다.

가장 분명한 사례는 공간 주석입니다. 모든 이미지에 크고 중앙에 놓인 대상이 하나씩 있는 코퍼스라면, 누가 주석을 달든 평균 IoU는 0.95 안팎이 나옵니다. 이미지를 한 번도 보지 않고 가운데에 박스를 그린 주석자라도 마찬가지입니다. "이 주석자들은 일치한다"와 "이 과제는 불일치가 생길 수 없을 만큼 쉽다"를 갈라놓는 것이 바로 우연 일치 보정입니다.

대부분의 주석 플랫폼은 일치도를 원시 IoU, 완전 일치, 또는 정답 작업 대비 일치율로 보고합니다. 유용한 수치이지만 답하는 질문이 다릅니다. 공간 라벨에 대해 우연 일치를 보정한 계수를 보고하는 주석 플랫폼은 달리 찾지 못했습니다.

두 가지 설계 원칙

정의되지 않은 값은 스스로를 설명합니다. 만장일치 코퍼스에서 α는 실제로 정의되지 않습니다. 맨 NaN은 계산이 고장 난 것처럼 보이고 1.0을 반환하면 거짓이 되므로, 보고서는 둘 중 어느 쪽인지를 말로 밝힙니다.

조용히 잘라내지 않습니다. 쌍별 비교 예산에 도달한 보고서는 그 사실을 밝히고 몇 건이 포함되었는지 명시합니다. 표본에서 계산된 수치를 전체에서 계산된 것처럼 제시하는 것은 수치가 아예 없는 것보다 나쁩니다.

이 계층이 존재하게 된 버그

예전에 조정 절차는 주석의 를 비교했고, 이미지 스키마는 _data라는 하나의 키에 모든 것을 저장합니다. 그래서 모든 이미지 쌍이 일치도 1.0으로 채점되었습니다. 아무것도 일치하지 않은 두 주석자가 만장일치로 보였고, 검토로 넘어가는 이미지는 하나도 없었습니다.

이 문제는 수정되었으며, 일치도 계층을 각 주석 유형 위에 덧붙이지 않고 안에 내장한 이유이기도 합니다.

데이터가 어떻게 만들어졌는가

일치도는 두 주석자가 확신을 갖고 같은 오답에 합의한 경우를 잡아내지 못하며, 읽지 않은 채 수용된 사전 라벨도 잡아내지 못합니다. 이를 다루는 두 가지 기능이 있습니다.

  • 드로잉 텔레메트리는 도형별 소요 시간, 스트로크 동역학, 수정 횟수, AI 제안 수용 지연을 기록합니다.
  • 키스트로크 로깅은 그 텍스트 쪽 대응물로, 자유 서술 답변이 어떻게 작성되었는지를 기록합니다.

둘 다 선택적으로 활성화되며, 주석자에게는 기록 중이라는 안내가 표시됩니다.

신뢰성과 배포

  • 에어갭 배포 — 모든 자산이 자체 설치본에서 제공되며, 외부 요청이 0건임이 검증되어 있습니다.
  • 기계 판독 가능한 명세 — JSON Schema와 OpenAPI 문서로, 둘 다 코드에서 생성되고 CI에서 검사됩니다.

관련 문서