時間維度上的一致性
用於片段邊界的時間 IoU、邊界 α,以及為什麼斷點一致性是以容差掃描的形式報告,而不是固定在某一個閾值上。
兩位標註者在標記一個事件何時開始時不會選中同一幀,因此時間一致性必須說明"多接近才算一致"——而這個選擇會改變結論。 Potato 報告的是整條掃描曲線,而不是替你挑一個閾值。
測量了什麼
| 問題 | 度量 |
|---|---|
| 片段是否重疊? | 時間 IoU |
| 邊界是否落在相同位置? | 邊界 α |
| 他們標記的是否是同一類事件? | 標籤上的名義 α |
| 他們是否認同確實發生了事件? | 檢測 α |
容差掃描
對於斷點與邊界類標註,一致性取決於匹配容差:兩個標記相距多遠,仍可算作同一個標記?
只報告單一閾值,等於邀請讀者去挑選那個恰好支援自己結論的容差。0.25 秒下的一致性和 2 秒下的一致性,是關於這份資料的兩種不同斷言:
- 在 2 秒下高、在 0.25 秒下低,意味著標註者認同發生了某個事件,但對具體時點看法不一。這通常是規範問題:對"何時開始"的定義不夠明確。
- 兩者都低,則意味著他們連事件是否發生都存在分歧。
因此報告會掃描容差並展示曲線。參見世界模型評估,其中斷點一致性會被進一步拆解為檢測、定位與類別三部分。
覆蓋率會一併報告
對於稠密曲線——例如機器人回合上的進度獎勵軌跡——一致性以 ICC 加 Pearson 的形式報告,並同時給出覆蓋率。
在時間軸 5% 的範圍上算出的相關係數,對其餘 95% 什麼也沒說;而一個不附帶覆蓋率的係數,會被當作覆蓋了全部來解讀。
一項已知侷限
時間片段目前只有未經校正的度量。σ 的機遇基線是由不同條目間的距離構建的,而當各段影片長度不同時,"來自另一段影片的片段"並不是一個有意義的比較物件。把這件事做對需要單獨的設計,在它成型之前就宣稱此處已有機遇校正,比直說沒有更糟。