几何形状上的一致性
Potato 如何为边界框与多边形报告经机遇校正的一致性——拆解为检测、分类与定位三部分,并以 σ 和 KS 统计量对照经验机遇基线。
Potato 把空间一致性拆成三个问题——标注者是否找到了相同的对象、是否给出了相同的名称、是否放在了相同的位置——并且用经验估计的机遇基线来回答第三个问题,而不是用原始 IoU。
原始 IoU 的问题
CVAT 的共识引擎与 V7 的共识环节都以原始 IoU 对照每个类别的阈值来比较标注者。两者都没有做任何机遇校正,这使得那个头条数字本身无法解读:
如果一个语料中每张图片都只有一个居中的大目标,那么无论谁来标注,平均 IoU 都会在 0.95 左右。这也包括那些根本没看图片、只在中间画了一个框的标注者。
机遇校正的作用,就是把"这些标注者意见一致"和"这个任务根本没有分歧的余地"区分开。
在 1 − IoU 上套用 Krippendorff's α 行不通
这原本是这里的初始方案,而从实证来看它是错误的默认选择。
Braylan、Alonso 与 Lease(WWW 2022)以"所得的一致性分数能否正确地对标注者质量排序"作为评估候选距离函数的标准——这才是真正重要的性质——并报告称:对于边界框,α 会把普通 L2(0.687)排在 IoU(0.505)与 GIoU(0.507)之上,这与他们自己基于分布的度量以及实践者的判断都恰好相反。
这背后有结构性的原因。IoU 距离被限制在 [0, 1] 区间内并且会饱和:随机配对的两个形状几乎总是 IoU 为 0,于是期望分歧收敛到约等于 1,α 退化为 1 − 平均距离,其中已不剩任何有效的机遇校正。
普通 IoU 还会在最关键的地方失去分辨力。两个不相交的框,无论是彼此相邻还是分处图像的对角,得分都是 0,因此恰恰在标注者产生分歧的地方,这个度量没有梯度。
Potato 实际报告的内容
σ,主要度量
σ = 1 − 平均(同一条目内距离) / 平均(不同条目间距离)
这是把 α 自身的 1 − D_o/D_e 形式推广到任意距离,其中机遇基线通过比较不同条目的标注来经验地估计。
| σ | 含义 |
|---|---|
| 1.0 | 完全一致 |
| 0.0 | 标注者之间的一致程度,与他们在互不相关的条目上的表现无异 |
| 小于 0 | 系统性分歧,通常是定义问题,而非粗心 |
负值不会被截断到零。"在同一张图上比在不同图上分歧更大"是一种真实且可诊断的状态,把它藏起来对谁都没有好处。
KS,配套度量
同一条目内与不同条目间两组距离分布之间的双样本 Kolmogorov–Smirnov 统计量。σ 比较的是两个均值,可能被少数离群值拖动;KS 比较的是整个分布,在条目难度参差不齐时更稳健。
两者都要看。它们互相矛盾本身就是有用的信息:这意味着少数条目承载了绝大部分分歧。
拆解
单一的空间一致性数字无法说明三种不同失效中发生了哪一种:
| 组成部分 | 问题 | 度量 |
|---|---|---|
| 检测 | 他们究竟有没有找到相同的对象? | 存在性上的名义 α |
| 分类 | 对已匹配的对象,他们给出的标签是否相同? | 标签上的名义 α |
| 定位 | 已匹配的对象是否位于相同位置? | σ 与 KS,外加 GIoU 距离 |
一位找全了所有对象却把标签全标错的标注者,和一位标签正确但框画得松垮的标注者,是两种不同的问题,而一个合并后的分数无法区分它们。
配置
agreement_metrics:
enabled: true报告位于 /admin/iaa。