Skip to content

几何形状上的一致性

Potato 如何为边界框与多边形报告经机遇校正的一致性——拆解为检测、分类与定位三部分,并以 σ 和 KS 统计量对照经验机遇基线。

Potato 把空间一致性拆成三个问题——标注者是否找到了相同的对象、是否给出了相同的名称、是否放在了相同的位置——并且用经验估计的机遇基线来回答第三个问题,而不是用原始 IoU。

原始 IoU 的问题

CVAT 的共识引擎与 V7 的共识环节都以原始 IoU 对照每个类别的阈值来比较标注者。两者都没有做任何机遇校正,这使得那个头条数字本身无法解读:

如果一个语料中每张图片都只有一个居中的大目标,那么无论谁来标注,平均 IoU 都会在 0.95 左右。这也包括那些根本没看图片、只在中间画了一个框的标注者。

机遇校正的作用,就是把"这些标注者意见一致"和"这个任务根本没有分歧的余地"区分开。

在 1 − IoU 上套用 Krippendorff's α 行不通

这原本是这里的初始方案,而从实证来看它是错误的默认选择。

Braylan、Alonso 与 Lease(WWW 2022)以"所得的一致性分数能否正确地对标注者质量排序"作为评估候选距离函数的标准——这才是真正重要的性质——并报告称:对于边界框,α 会把普通 L2(0.687)排在 IoU(0.505)与 GIoU(0.507)之上,这与他们自己基于分布的度量以及实践者的判断都恰好相反。

这背后有结构性的原因。IoU 距离被限制在 [0, 1] 区间内并且会饱和:随机配对的两个形状几乎总是 IoU 为 0,于是期望分歧收敛到约等于 1,α 退化为 1 − 平均距离,其中已不剩任何有效的机遇校正。

普通 IoU 还会在最关键的地方失去分辨力。两个不相交的框,无论是彼此相邻还是分处图像的对角,得分都是 0,因此恰恰在标注者产生分歧的地方,这个度量没有梯度。

Potato 实际报告的内容

σ,主要度量

text
σ = 1 − 平均(同一条目内距离) / 平均(不同条目间距离)

这是把 α 自身的 1 − D_o/D_e 形式推广到任意距离,其中机遇基线通过比较不同条目的标注来经验地估计。

σ含义
1.0完全一致
0.0标注者之间的一致程度,与他们在互不相关的条目上的表现无异
小于 0系统性分歧,通常是定义问题,而非粗心

负值不会被截断到零。"在同一张图上比在不同图上分歧更大"是一种真实且可诊断的状态,把它藏起来对谁都没有好处。

KS,配套度量

同一条目内与不同条目间两组距离分布之间的双样本 Kolmogorov–Smirnov 统计量。σ 比较的是两个均值,可能被少数离群值拖动;KS 比较的是整个分布,在条目难度参差不齐时更稳健。

两者都要看。它们互相矛盾本身就是有用的信息:这意味着少数条目承载了绝大部分分歧。

拆解

单一的空间一致性数字无法说明三种不同失效中发生了哪一种:

组成部分问题度量
检测他们究竟有没有找到相同的对象?存在性上的名义 α
分类对已匹配的对象,他们给出的标签是否相同?标签上的名义 α
定位已匹配的对象是否位于相同位置?σ 与 KS,外加 GIoU 距离

一位找全了所有对象却把标签全标错的标注者,和一位标签正确但框画得松垮的标注者,是两种不同的问题,而一个合并后的分数无法区分它们。

配置

yaml
agreement_metrics:
  enabled: true

报告位于 /admin/iaa

相关内容