負責任地收集標註者人口統計資訊:該問什麼,以及怎麼問
在主觀任務上,標註者的身份會影響標籤,因此人口統計資訊值得收集,但前提是取得同意並說明理由。該問什麼、該放過什麼,以及如何在 Potato 中跑通這套流程。
多數標註項目把標註者視為可互換的:標籤就是標籤,誰標的都一樣。對不少任務來說這確實成立。但對另一些任務並非如此,而當你決定去了解標註者是誰的那一刻,你就接手了一個不大不小的研究倫理問題。人口統計資料是一個人能交給你的最敏感的資訊之一,"它可能有用"並不足以構成收集它的理由。
在主觀任務上,標註者的背景會影響標籤,因此人口統計資訊往往值得收集,但前提是取得知情同意、為每個欄位給出明確理由、提供便捷的拒答方式,並且對收集到的內容有匿名化和披露的計劃。只收集能回答你問題的最小集合,優先採用標準化量表而非臨時擬定的問題,並把這些人口統計資訊當作你將要公開記錄的東西來對待,而不只是存起來。
誰來標註為何會體現在標籤裡
標註者身份重要的最直接證據,來自一個專為這個問題構建的資料集。POPQUORN(Pei 與 Jurgens,2023)從 1,484 位標註者處收集了 45,000 條標註,抽樣上按性別、年齡和種族匹配美國人口結構,然後考察背景是否能預測人們的標註方式。答案是能。在冒犯性和禮貌度判斷上,年齡、種族和受教育程度都是統計顯著的因素;舉例來說,黑人標註者對同樣的評論給出的冒犯性評分高於其他群體。這是人們閱讀同一段文本方式上的真實差異,而不是可以求平均抹掉的噪聲。
把分歧的群體評分平均成單一黃金標籤,會掩蓋人口統計資訊本可揭示的規律
這一點關聯到關於真值的一個更廣泛的論點。Plank(2022)認為人類標籤的變異往往是真實的而非錯誤,而如果變異是真實的,那麼知道哪個標籤由誰產生,就是理解資料的一部分。在主觀任務上,一個經過聚合的黃金標籤會抹去分歧,而人口統計資訊本可以讓你看見這些分歧。(我們在分歧是訊號而非噪聲中對此有更深入的討論。)
因此,只要你的任務帶有主觀性,標註者群體的構成就是你資料集的一項屬性;而如果你從未問過,就既無法披露它,也無法審計它。
該收集什麼,該放過什麼
誘惑在於把什麼都問一遍,之後再慢慢理清。要剋制住。你收集的每一個人口統計欄位,都是你需要論證、保護並最終披露的欄位,其中一些還在法律上高度敏感:種族、族裔、宗教、政治觀點和健康資料屬於 GDPR 下的特殊類別,附帶額外義務。預設做法應當是取能回答你實際問題的最小集合。
對每個欄位可以做一個有用的檢驗:沿這個維度的差異,是否有可能改變一個人標註你資料的方式,而你是否真的會去分析它?如果你標註的是冒犯性,POPQUORN 的結果讓年齡、種族和受教育程度都站得住腳。如果你標註的是一個句子是否合乎語法,這些都不該出現在表單上。一個你永遠不會去看的屬性,是白白承擔的風險。
有兩項做法能讓這件事保持誠實:
- 把每個問題繫結到一項分析上。 在某個欄位進入表單之前,先寫下你打算用它做的比較。沒有比較,就沒有這個欄位。
- 讓一切都可跳過。 敏感問題需要一個真正的"不願回答"選項,而不是一個必填的單選按鈕。一個感到被迫披露的人,要麼退出,要麼給你一個垃圾答案,兩者都比留空更糟。
把知情同意做對
收集人口統計資訊,是標註從資料工作變成涉及人類受試者研究的分界點。底線是知情同意:在任何人回答人口統計問題之前,他們應當知道你在收集什麼、為什麼收集、誰會看到,以及他們可以隨時停止而不受懲罰。在實踐中這意味著一個標註者在人口統計問題載入之前閱讀並同意的頁面,而不是埋在服務條款牆裡的一個條款。
有幾件事能讓同意成為實質而非形式:
- 自願參與,並由介面強制保障。 只有當拒絕很容易時,拒絕權才算數。每個敏感項都要有"不願回答",並且要有一條不損失已掙報酬就能退出研究的途徑。
- 自我申報,而非推斷。 人口統計資訊應當來自標註者本人,絕不能從姓名、位置或文字風格中猜測。推斷出來的屬性既經常出錯,也比直接詢問構成更嚴重的隱私侵犯。
- 匿名化儲存。 把人口統計回答與任何能識別個人身份的資訊分開。你要能說"自我認同為 X 的評分者給出的分數更高",同時無法指出那具體是哪一個人。
如果你在大學體系內工作,這通常需要與倫理審查委員會(IRB)溝通,而 IRB 關心的正是這些點。即便不在大學體系內,這些原則依然成立。
同意頁面為人口統計問卷把關;每個敏感欄位都可跳過,回答在標註開始前完成匿名化
標準化的人口統計量表
當你確實要收集某項人口統計資訊時,措辭的重要性超出多數人的預期。臨時擬定的問題會產生與別人對不上的類別,無法跨研究比較,而且在選項的框定上經常出問題,在性別和種族上尤其明顯。解決辦法是借用社會科學家已經打磨了幾十年的工具:美國全國選舉研究(ANES)或綜合社會調查(GSS)的人口統計量表,提供了經過檢驗、站得住腳、且可與大量既有工作相比較的問題措辭與選項。
採用標準量表還替你完成了一部分倫理工作。這些工具本身就包含"不願回答"選項,並且在如何處理敏感類別上經過審查,因此你不必重新發明一套可能被審查委員會挑出問題的選項。
收集之後要披露
收集了人口統計資訊卻再也不提,就失去了意義。收集這些資料的理由,是讓你以及此後所有使用該資料集的人,都能看見標籤是由誰產生的。這類披露有標準形式:資料宣告(Bender 與 Friedman,2018)包含一個標註者人口統計章節,正是為了讓下游使用者判斷資料的泛化範圍;資料集說明書(Gebru 等)對任何機器學習資料集提出同樣的要求。在規劃收集的同時就規劃釋出:只公佈聚合分佈、絕不公佈個體記錄,同時要有足夠的細節讓讀者判斷你的標註者群體是否類似於模型將要服務的人群。這一端我們在為標註資料集撰寫文件中有專門討論。
在 Potato 中怎麼做
Potato 有一部分正是為此而建。POPQUORN 就是"Potato-Prolific"資料集,通過在 Prolific 上執行 Potato 研究收集而來,因此同意與人口統計流程是內建的,而不是後來拼上去的。
接入流程是一個多階段工作流:一個為研究把關的 consent 階段,然後是收集人口統計資訊的 prestudy 階段,最後才是標註本身。
phases:
consent:
enabled: true
data_file: "data/consent.json"
prestudy:
enabled: true
data_file: "data/demographics.json"
# annotation phase is always enabled同意頁面是一個帶 right_label 的問題,也就是繼續所必須給出的答案。沒有先同意,誰都到不了人口統計問卷或任務本身。
[
{
"name": "consent_agreement",
"type": "radio",
"description": "I have read the consent form, understand my responses are anonymized, and agree to participate. I may stop at any time.",
"labels": ["I agree", "I do not agree"],
"right_label": "I agree",
"required": true
}
]至於人口統計問題本身,給每個敏感問題配上"不願回答"選項,並在那些不好處理的類別上使用內建模板:
[
{
"name": "age_range",
"type": "radio",
"description": "What is your age range?",
"labels": ["18-24", "25-34", "35-44", "45-54", "55+", "Prefer not to answer"]
},
{
"name": "ethnicity",
"type": "select",
"description": "Which best describes you? (optional)",
"template": "ethnicity",
"free_response": true,
"free_response_label": "Prefer to self-describe"
}
]如果你根本不想手寫這些問題,Potato 附帶了經過驗證的問卷量表,其中包括八套標準化的人口統計量表。把 prestudy 階段指向 ANES 或 GSS 的人口統計量表,就能免費獲得經過檢驗的措辭:
phases:
prestudy:
type: prestudy
instrument: "anes-demographics" # or gss-demographics, acs-demographics, ...帶同意流程的人口統計示例是這整套流程的可直接執行版本;如果你想測量的不止人口統計,經過驗證的問卷量表介紹了更完整的量表庫。
研究一旦跑起來,人口統計回答會與標籤一併按標註者儲存,這正是讓你能做那項"當初據以論證收集必要性"的分析的前提:按群體拆解一致性,並檢驗某項人口統計特徵是否像 POPQUORN 發現的那樣能預測標籤。Potato 會在標註上報告 Cohen's 與 Fleiss' kappa,因此你可以測量群體歸屬是否真的推動了標籤,而不必靠猜。當你釋出資料時,prestudy 階段的聚合分佈就是你資料宣告中的標註者人口統計章節,早已收集完畢。
接下來讀什麼
- 分歧是訊號而非噪聲,講的是為什麼標籤中的人口統計差異往往正是你想保留的東西。
- 為標註資料集撰寫文件,講如何把收集到的人口統計資訊變成資料宣告或資料集說明書。
- 標註者間一致性詳解,講你在按群體分析標籤時所用的統計方法。
- 在 Prolific 和 MTurk 上開展眾包研究,講如何從一開始就招募到人口結構均衡的標註者群體。