VLM의 그라운딩과 포인팅을 평가하는 방법
그라운딩은 여러 임계값의 IoU로, 포인팅은 영역 내 적중률로 채점하고, 그라운딩 불가는 그 자체를 하나의 답으로 셉니다. 점을 박스처럼 채점하면 반드시 실패하는 이유.
그라운딩 평가는 모델이 올바른 자리에 영역을 놓았는지를 묻고, 포인팅 평가는 올바른 대상 위에 점을 놓았는지를 묻습니다. 둘은 서로 다른 측도를 필요로 하며, 포인팅에 그라운딩의 측도를 쓰면 완벽하게 짚고 있는 모델이 전면적 실패로 보고됩니다.
그라운딩: 여러 임계값을 보고한다
그라운딩은 사람이 그린 영역에 대한 IoU로, 0.25, 0.5, 0.75, 0.9 각 임계값에서 채점하십시오.
임계값 하나로는 "거의 맞음"과 "전혀 아님"을 구분할 수 없고, 딱 0.5를 넘도록 조정된 모델은 정말로 정밀한 모델과 구별되지 않습니다. 임계값 전반에 걸친 곡선의 모양이 곧 발견입니다.
포인팅은 작은 박스로 하는 그라운딩이 아니다
Molmo 계열 모델은 점을 내놓습니다. 점에는 면적이 없으므로 점에 대한 IoU는 모두 0입니다. 포인팅 모델을 그라운딩 모델처럼 채점하면, 아무리 잘 짚어도 완전한 실패로 보고됩니다.
점이 답하는 질문은 "그것이 대상 안에 있는가"이므로, 측도는 적중률, 즉 point_in_region입니다.
mean_miss_distance는 빗나간 경우만 대상으로 보고하십시오. 적중까지 포함해 평균을 내면, 모델이 얼마나 크게 빗나갔는지가 아니라 대상이 얼마나 큰지를 재게 됩니다.
점에 대한 주석자 간 일치도는 거리다
같은 구조적 문제가 주석자들 사이에도 나타납니다. 겹침에 기반한 측도를 점에 적용하면 포화됩니다. 같은 이미지의 반대쪽 모서리를 가리키는 두 주석자도 약 0.86이 나오고, 어떤 계수 척도에서든 강한 일치로 분류됩니다.
그러니 정규화된 이미지 좌표에서 주석자들의 점 사이 평균 거리와 중앙값 거리를 보고하십시오. 0이 완전한 일치입니다. 거리에는 포화될 천장이 없고, 그것을 거리라고 부르면 아무도 계수처럼 등급을 매기지 않게 됩니다.
그라운딩 불가는 서로 다른 세 가지 오류다
이들은 따로 추적하십시오.
| 결과 | 뜻 |
|---|---|
| 올바르게 사양함 | 그 표현이 존재하지 않는 것을 가리키며, 모델도 그렇게 말함 |
| 위치를 환각함 | 거기 없는 것에 대해 영역을 내놓음 |
| 존재하는 지시 대상을 놓침 | 거기 있었는데 찾아내지 못함 |
이것들을 하나의 "틀림" 수치로 뭉치면, 과도하게 주장하는 모델과 소극적으로 주장하는 모델의 차이가 가려집니다. 둘은 고치는 방향이 반대입니다.
주석자가 한 번도 답하지 않은 표현은 실패로 세지 않고 제외합니다. 세어 버리면 건너뛴 문구가 많을수록 모델이 나빠 보이는데, 그것은 모델이 아니라 주석자에 관한 진술입니다.
영역 캡션에는 의미 거리가 필요하다
같은 대상을 기술하는 두 주석자가 내용어를 공유하는 일은 드뭅니다. "손잡이가 깨진 빨간 머그"와 "왼쪽에 있는 상한 컵"은 같은 영역을 기술하지만 겹치는 내용어가 없습니다.
캡션 일치도는 문자열 겹침이 아니라 의미 거리를 통해 계산하십시오. Krippendorff's α는 어떤 거리 함수든 받아들이므로, 거리만 옳다면 같은 계수 장치를 그대로 쓸 수 있습니다.
설정
annotation_schemes:
# grounding_eval owns the binding but does not draw, so an image schema
# supplies the canvas.
- annotation_type: image_annotation
name: region
description: "Draw the region for the selected phrase."
source_field: image
tools: [bbox, polygon, landmark]
labels: [{name: referent, color: "#6e56cf"}]
- annotation_type: grounding_eval
name: grounding
description: "What does each phrase refer to?"
region_type: box # use `point` for pointing evaluation
expressions_field: expressions항목은 안정적인 ID와 함께 문구를 담습니다.
{"id": "img1", "image": "/media/img1.jpg",
"expressions": [{"id": "e1", "text": "the man in the red shirt"}]}문자열만 나열해도 동작하지만, 그러면 ID가 위치로 물러나므로 목록 순서를 바꾸면 기존 주석이 다른 대상을 가리키게 됩니다.
동작하는 예시: RefCOCO와 PixMo-Points 쇼케이스 설계.
모델 예측을 검토할 때
정답 데이터를 모으는 것이 아니라 모델을 감사하는 중이라면, 예측은 끝까지 예측으로 표시된 채로 두십시오. 주석자가 수용하지 않은 예측은 모델에 관한 증거이며, 사람의 영역에 섞어 넣으면 그것이 존재하는 유일한 이유가 사라집니다.