Skip to content

如何在預標註資料中區分認真複核與走過場

當標註者不讀就接受模型預標註時,所有品質指標都會變好,一致性也不例外。時間是唯一能把認真複核與走過場式蓋章區分開的訊號。

預標註讓標註者更快,也讓走過場式的蓋章毫無阻力,而任何從標註本身算出的指標都無法把兩者區分開。 幾何形狀完全相同,而標註者間一致性還會上升,因為都接受同一份模型輸出的標註者,在構造上就是一致的。

唯一能顯出差別的地方,是時間。

品質指標為什麼在這裡會失效

假設一個模型為每張圖片都做了預標註,而三位標註者幾乎全盤接受。

  • 一致性會上升,因為他們記錄的都是模型的輸出。
  • 基準準確率會在模型判斷正確之處上升,而那是大多數情況。
  • 需要裁決的量會下降,因為沒有什麼可裁決的。

每一塊看板都變好看了。而這份資料集如今不過是一份模型與自己達成一致的記錄,其錯誤是系統性的而非隨機的——這是最糟的一類,因為它們不會在多位標註者之間被平均掉。

對 2026 年的工作流來說,這並非假設。一鍵自動標註正在成為全行業的預設做法,而信度相關的文獻對此沒有任何度量,因為經機遇校正的一致性是為獨立判斷設計的,而這些判斷並不獨立。

該記錄什麼

時間,精確到單次接受這一層級:

訊號它能說明什麼
AI 接受延遲從建議被呈現到被接受的時間。最有用的單一數字。
每個圖形的耗時一份繪製出來的標註所花的時間是否合理
修改次數放置之後是否做過任何修正
筆跡動態一份掩碼是畫出來的,還是整份被接受的
縮放行為標註者是否曾經湊近看過

上述任何一項都不需要座標,而且你也不應當採集座標。一份無法還原標註本身的過程記錄,向倫理委員會解釋起來要容易得多,而且它同樣能回答這個問題。

如何讀這些數字

人無法在 300 毫秒內檢視一條掩碼邊界並做出判斷。偶爾一次也許可以,如果目標很明顯的話。但作為跨大量條目的中位數,那就不是熟練。

要讀分佈,絕不要在單個條目上設閾值。三條經得起推敲的原則:

  1. 把每位標註者與項目本身比較,而不是與某個常數比較。 簡單的語料確實就是快。在你自己的項目內做百分位校準,是唯一站得住腳的基線。
  2. 尋找連續片段。 連續二十次低於 500 毫秒的接受,比分散的二十次要有力得多。
  3. 按是否存在建議來切分。 標註者自己繪製的速度,是衡量其接受速度的天然對照。

這件事做不到什麼

它不檢測欺詐,也不給標註者下定論。一次標記是"值得去看看"的提示,而非結論。

基準率很重要,也很容易被忘記:在一個 80% 的條目確實簡單的語料中,快通常就是對的,而一條為抓走過場而調好的規則,最終大多會抓到"能力強"。這正是閾值應當屬於你的項目、而非隨產品預置的原因。

在 Potato 中如何做

yaml
annotation_telemetry:
  enabled: true
  fidelity: events
  idle_ms: 120000

對於自由文本答案,與之對應的是擊鍵記錄,它能區分"逐字寫出的"、"謄抄的"與"貼上的"文本。它在 beforeinput 而非 keydown 上捕獲,因為貼上、拖放、輸入法、語音聽寫與自動填充都會在不觸發 keydown 的情況下改變欄位內容——所以只監聽 keydown 的記錄器,恰恰對它本該抓住的那些情況視而不見。

兩者都不附帶預訓練的分類器。走過場行為並不存在帶標註的語料,而把擬合出來的係數說成"已驗證",就是在編造驗證。

倫理

標註者會看到錄製提示,並且該提示預設開啟。這是研究工具與監控之間的分界線,值得在你的知情同意文本中明確寫清:記錄什麼(時間與過程)、不記錄什麼(內容與座標)、保留多久,以及將用於什麼用途。

同意書示例文本與保留期相關的問題,參見擊鍵記錄的倫理

延伸閱讀