LLM 標註員對比人工:什麼時候該把標註任務交給機器,什麼時候不該
一份實用指南,幫你判斷何時可以讓 LLM 標註你的資料、模型標註員會在哪裡失手,以及如何在 Potato 裡把自動化與人工核驗結合起來。
如今每個標註項目都會碰到這個問題:這件事我們還需要人嗎,還是讓模型直接做?這是個合理的問題。LLM 標註員快、不知疲倦,成本只有眾包的一個零頭。誠實的回答是:它取決於任務,而且以你實際能預判的方式取決於任務;出問題的項目,通常正是那些從沒核對過的。
當任務定義清晰、標籤客觀、並且你能拿一份人工黃金樣本來衡量它時,LLM 是個好標註員。當標籤主觀、帶有文化包袱,或者新到還沒有任何標準答案時,它就是個差標註員。穩妥的預設做法是:把模型能可靠完成的自動化,其餘的抽一份樣本核驗,難的留給人。 這篇文章講的就是如何把這幾類分辨開。
誠實的回答:取決於任務
研究並沒有說「LLM 取代標註員」或「LLM 不能標註」。它說的更有用,是表現按任務類型分化。Gilardi、Alizadeh 和 Kubli(2023)發現 ChatGPT 在相關性、立場和框架檢測上勝過眾包工人,一致性更高、成本近乎為零。但 Ziems 等人(2024)在 25 個計算社會科學基準上測了 13 個模型,畫面並不整齊:在分類任務上 LLM 與人工只達到中等一致,也很少勝過一個微調模型;而在自由形式的解釋上,它們產出的內容往往讀起來比眾包的參考答案還好。
所以「LLM 能標這個嗎?」其實是兩個問題。這是模型擅長的那類任務嗎?以及在我的具體資料上,模型真的和人一致嗎?第一個你可以從任務類型來推斷,第二個你必須測量。
LLM 標註員會在哪裡失手
這些失手並不隨機。它們成簇出現,也就意味著你可以預判。
- 主觀與文化性標籤。 毒性、冒犯、幽默、禮貌、道德判斷,都取決於是誰在讀。單一模型給出一個被壓平的答案,而一個多元的標註員群體本會以富含資訊的方式產生分歧——而那種分歧往往正是你想要的訊號。
- 比較中的系統性偏差。 當 LLM 評判兩個回答時,它並不是中立的裁判。Zheng 等人(2023)記錄了位置偏差(它偏愛先出現的選項)、冗長偏差(它獎勵更長的回答)和自我增強偏差(它偏愛自己風格的文本)。這些偏差是一致的,因此會把你整份資料集朝一個方向推,而不是新增噪聲。
- 還沒有標準答案。 如果你在構建一套全新的編碼方案,就沒有任何東西能用來驗證模型,而一個自信的錯標比一處誠實的空白更糟。新方案需要人工編碼員先上,哪怕只是為了造出黃金集。
- 悄然漂移。 模型的行為會在長語料上、以及跨版本地發生變化。沒有一份你反覆對照的固定黃金樣本,你不會察覺標籤分佈正在你腳下移動。
這些都不意味著「永遠別用模型」。它們意味著模型的輸出是一份有力的初稿,而不是最終標籤。
行之有效的模式
行之有效的做法不是全模型或全人工,而是一種分流:把每個條目送進與其難度相稱的通道。
自動化模型擅長的,抽查核驗其餘的,難的留給人
先在一份帶標籤的黃金樣本上跑模型,逐標籤地看一致性,而不只看整體。它和人一致的地方,讓它承擔那些條目並抽查一部分;一致性居中的地方,保留模型的建議但讓人逐條確認;標籤主觀或決定高風險的地方,留給人工標註員,模型至多作為提示。這些比例會隨項目推進而變化——你會逐漸摸清模型在哪裡可信——但形狀不變。
有一條護欄自始至終都重要:留一份模型永遠碰不到的、純人工的盲測切片。那是你的標尺。沒有它,自動化偏見就會滋生,核對者給看似合理的建議蓋章放行,於是你測出的一致性向上漂移,而真實品質並沒有。
成本和品質不是同一個維度
人們很容易把這框成「便宜的模型對昂貴的人」,但這掩蓋了真正的取捨。一個模型標籤幾乎不花什麼就能產出,要信任它卻要花實打實的代價:你為驗證它而造的黃金集、那一遍人工核驗、那些抽查。一個人工標籤前期花得多,信任它卻花得少。對一個大而客觀的任務,一旦驗證成本被攤薄,模型在總成本上勝出;對一個小或主觀的任務,驗證的開銷可能比直接讓人來標還貴。別假設模型更便宜,就你的任務算一算賬。
在 Potato 裡怎麼做
Potato 就是為跑這種混合流程而造的,而不是逼你在全有或全無之間選。開啟 AI 支援讓模型做預標註,再讓人核驗:
ai_support:
enabled: true
endpoint_type: openai # or anthropic, gemini, ollama, ...
ai_config:
model: gpt-4
api_key: ${OPENAI_API_KEY}
temperature: 0.2模型提出一個標籤;標註員確認或糾正,被核驗過的那個標籤才會被儲存。至於分流本身,一個分診(triage)方案能讓人飛快地過一遍模型建議,留下明確的,把其餘的標記出來做更細的標註。
要衡量模型對人工,不要給你留作測一致性的條目做預填。留一份盲測切片,讓人來標,再用 Cohen 或 Fleiss 的 kappa 比較。那個數字——逐標籤地看——就決定了你任務的每一部分歸入哪條通道。預標註指南更詳細地講了防自動化偏見的護欄。
繼續閱讀
- 給 AI 標註員的碼本,講如何把編碼方案變成 LLM 能執行的模型。
- LLM 與視覺預標註,講模型建議與核驗的機制。
- 你能信任你的 LLM 評判嗎?,講如何用人工評分校準 LLM 評判。
- 標註中的主動學習,講把人力花在最能教會模型的條目上。