Skip to content

測量與完整性

Potato 會針對幾何形狀、時間、三維立方體、區域描述以及世界模型斷點報告經機遇校正的一致性,並記錄標註是如何產生的。本節概述測量相關的能力。

Potato 中的每一種標註類型都配有一種衡量標註者是否一致的方法,經過機遇校正,並且明確說明其失效情形。 這包括空間與時間類型,而業界在這兩類上的通行做法是原始 IoU 或百分比匹配,兩者都沒有經過機遇校正。

本節涵蓋問題的兩個方面:標籤是否一致,以及它們是如何產生的。

貫穿始終的問題

問題度量
標註者是否找到了相同的物件?檢測 α
他們是否給出了相同的名稱?分類 α
他們是否把物件放在了相同的位置?σ 與 KS,對照經驗機遇基線
該採信誰的掩碼?STAPLE
他們對事件何時開始是否一致?時間 IoU 與邊界 α
他們對三維框是否一致?精確的帶旋轉三維 IoU
他們對同一區域的描述是否一致?α,配合文本上的語義距離
他們對世界在何處崩壞是否一致?斷點一致性,配合容差掃描
某位標註者是否勝任?MACE,用於真正屬於類別型的部分

為什麼需要機遇校正

只要某一個答案佔據主導,原始一致率就會被抬高,而幾乎總有一個答案佔據主導。

最清楚的例子是空間標註。如果一個語料中每張圖片都只有一個居中的大目標,那麼無論誰來標註,平均 IoU 都會在 0.95 左右——包括那些根本沒看圖片、只在中間畫了一個框的標註者。機遇校正的作用,就是把"這些標註者意見一致"和"這個任務根本沒有分歧的餘地"區分開。

多數標註平臺以原始 IoU、精確匹配,或與某個基準任務的百分比一致率來報告一致性。這些都是有用的數字,只是它們回答的是另一個問題。我們沒有找到任何其他標註平臺會為空間標籤報告經機遇校正的係數。

兩項設計取捨

未定義的數值會自我說明。 在完全一致的語料上,α 確實是未定義的。直接給出 NaN 會讓人以為計算出錯,而給出 1.0 則是謊報,因此報告會用文字說明屬於哪一種情況。

不會無聲地截斷。 報告若觸及成對比較的預算上限,會明確說明,並給出實際納入的條目數。一個基於抽樣得出、卻表現得像基於全量得出的數字,比沒有數字更糟。

這一層之所以存在的那個缺陷

裁決邏輯過去比較的是標註的鍵名,而影像模式會把所有內容存放在一個名為 _data 的鍵下。於是每一對影像標註都會得到 1.0 的一致性:兩位在任何地方都不一致的標註者看上去完全一致,並且沒有任何一張圖片被送去複核。

該問題已經修復,這也正是一致性計算內建於每種標註類型之中、而非外掛在其之上的原因。

資料是如何產生的

一致性無法識別兩位標註者篤定地在錯誤答案上取得一致,也無法識別未經閱讀就被接受的預標註。有兩項能力用於彌補這一點:

  • 繪製遙測 記錄每個圖形的耗時、筆跡動態、修改次數,以及接受 AI 建議的延遲。
  • 擊鍵記錄 是其在文本側的對應物,用於瞭解一段自由文本答案是如何寫出來的。

兩者都需要顯式開啟,並且標註者會看到錄製提示。

信任與部署

  • 氣隙部署——所有資源都由你自己的安裝提供,並已在零外部請求的前提下驗證。
  • 機器可讀規格——一份 JSON Schema 和一份 OpenAPI 文件,均由程式碼生成並在 CI 中校驗。

相關內容