Skip to content

时间维度上的一致性

用于片段边界的时间 IoU、边界 α,以及为什么断点一致性是以容差扫描的形式报告,而不是固定在某一个阈值上。

两位标注者在标记一个事件何时开始时不会选中同一帧,因此时间一致性必须说明"多接近才算一致"——而这个选择会改变结论。 Potato 报告的是整条扫描曲线,而不是替你挑一个阈值。

测量了什么

问题度量
片段是否重叠?时间 IoU
边界是否落在相同位置?边界 α
他们标记的是否是同一事件?标签上的名义 α
他们是否认同确实发生了事件?检测 α

容差扫描

对于断点与边界类标注,一致性取决于匹配容差:两个标记相距多远,仍可算作同一个标记?

只报告单一阈值,等于邀请读者去挑选那个恰好支持自己结论的容差。0.25 秒下的一致性和 2 秒下的一致性,是关于这份数据的两种不同断言:

  • 在 2 秒下高、在 0.25 秒下低,意味着标注者认同发生了某个事件,但对具体时点看法不一。这通常是规范问题:对"何时开始"的定义不够明确。
  • 两者都低,则意味着他们连事件是否发生都存在分歧。

因此报告会扫描容差并展示曲线。参见世界模型评估,其中断点一致性会被进一步拆解为检测、定位与类别三部分。

覆盖率会一并报告

对于稠密曲线——例如机器人回合上的进度奖励轨迹——一致性以 ICC 加 Pearson 的形式报告,并同时给出覆盖率

在时间轴 5% 的范围上算出的相关系数,对其余 95% 什么也没说;而一个不附带覆盖率的系数,会被当作覆盖了全部来解读。

一项已知局限

时间片段目前只有未经校正的度量。σ 的机遇基线是由不同条目间的距离构建的,而当各段视频长度不同时,"来自另一段视频的片段"并不是一个有意义的比较对象。把这件事做对需要单独的设计,在它成型之前就宣称此处已有机遇校正,比直说没有更糟。

相关内容