测量与完整性
Potato 会针对几何形状、时间、三维立方体、区域描述以及世界模型断点报告经机遇校正的一致性,并记录标注是如何产生的。本节概述测量相关的能力。
Potato 中的每一种标注类型都配有一种衡量标注者是否一致的方法,经过机遇校正,并且明确说明其失效情形。 这包括空间与时间类型,而业界在这两类上的通行做法是原始 IoU 或百分比匹配,两者都没有经过机遇校正。
本节涵盖问题的两个方面:标签是否一致,以及它们是如何产生的。
贯穿始终的问题
| 问题 | 度量 |
|---|---|
| 标注者是否找到了相同的对象? | 检测 α |
| 他们是否给出了相同的名称? | 分类 α |
| 他们是否把对象放在了相同的位置? | σ 与 KS,对照经验机遇基线 |
| 该采信谁的掩码? | STAPLE |
| 他们对事件何时开始是否一致? | 时间 IoU 与边界 α |
| 他们对三维框是否一致? | 精确的带旋转三维 IoU |
| 他们对同一区域的描述是否一致? | α,配合文本上的语义距离 |
| 他们对世界在何处崩坏是否一致? | 断点一致性,配合容差扫描 |
| 某位标注者是否胜任? | MACE,用于真正属于类别型的部分 |
为什么需要机遇校正
只要某一个答案占据主导,原始一致率就会被抬高,而几乎总有一个答案占据主导。
最清楚的例子是空间标注。如果一个语料中每张图片都只有一个居中的大目标,那么无论谁来标注,平均 IoU 都会在 0.95 左右——包括那些根本没看图片、只在中间画了一个框的标注者。机遇校正的作用,就是把"这些标注者意见一致"和"这个任务根本没有分歧的余地"区分开。
多数标注平台以原始 IoU、精确匹配,或与某个基准任务的百分比一致率来报告一致性。这些都是有用的数字,只是它们回答的是另一个问题。我们没有找到任何其他标注平台会为空间标签报告经机遇校正的系数。
两项设计取舍
未定义的数值会自我说明。 在完全一致的语料上,α 确实是未定义的。直接给出 NaN 会让人以为计算出错,而给出 1.0 则是谎报,因此报告会用文字说明属于哪一种情况。
不会无声地截断。 报告若触及成对比较的预算上限,会明确说明,并给出实际纳入的条目数。一个基于抽样得出、却表现得像基于全量得出的数字,比没有数字更糟。
这一层之所以存在的那个缺陷
裁决逻辑过去比较的是标注的键名,而图像模式会把所有内容存放在一个名为 _data 的键下。于是每一对图像标注都会得到 1.0 的一致性:两位在任何地方都不一致的标注者看上去完全一致,并且没有任何一张图片被送去复核。
该问题已经修复,这也正是一致性计算内建于每种标注类型之中、而非外挂在其之上的原因。
数据是如何产生的
一致性无法识别两位标注者笃定地在错误答案上取得一致,也无法识别未经阅读就被接受的预标注。有两项能力用于弥补这一点:
两者都需要显式开启,并且标注者会看到录制提示。