负责任地收集标注者人口统计信息:该问什么,以及怎么问
在主观任务上,标注者的身份会影响标签,因此人口统计信息值得收集,但前提是取得同意并说明理由。该问什么、该放过什么,以及如何在 Potato 中跑通这套流程。
多数标注项目把标注者视为可互换的:标签就是标签,谁标的都一样。对不少任务来说这确实成立。但对另一些任务并非如此,而当你决定去了解标注者是谁的那一刻,你就接手了一个不大不小的研究伦理问题。人口统计数据是一个人能交给你的最敏感的信息之一,"它可能有用"并不足以构成收集它的理由。
在主观任务上,标注者的背景会影响标签,因此人口统计信息往往值得收集,但前提是取得知情同意、为每个字段给出明确理由、提供便捷的拒答方式,并且对收集到的内容有匿名化和披露的计划。只收集能回答你问题的最小集合,优先采用标准化量表而非临时拟定的问题,并把这些人口统计信息当作你将要公开记录的东西来对待,而不只是存起来。
谁来标注为何会体现在标签里
标注者身份重要的最直接证据,来自一个专为这个问题构建的数据集。POPQUORN(Pei 与 Jurgens,2023)从 1,484 位标注者处收集了 45,000 条标注,抽样上按性别、年龄和种族匹配美国人口结构,然后考察背景是否能预测人们的标注方式。答案是能。在冒犯性和礼貌度判断上,年龄、种族和受教育程度都是统计显著的因素;举例来说,黑人标注者对同样的评论给出的冒犯性评分高于其他群体。这是人们阅读同一段文本方式上的真实差异,而不是可以求平均抹掉的噪声。
把分歧的群体评分平均成单一黄金标签,会掩盖人口统计信息本可揭示的规律
这一点关联到关于真值的一个更广泛的论点。Plank(2022)认为人类标签的变异往往是真实的而非错误,而如果变异是真实的,那么知道哪个标签由谁产生,就是理解数据的一部分。在主观任务上,一个经过聚合的黄金标签会抹去分歧,而人口统计信息本可以让你看见这些分歧。(我们在分歧是信号而非噪声中对此有更深入的讨论。)
因此,只要你的任务带有主观性,标注者群体的构成就是你数据集的一项属性;而如果你从未问过,就既无法披露它,也无法审计它。
该收集什么,该放过什么
诱惑在于把什么都问一遍,之后再慢慢理清。要克制住。你收集的每一个人口统计字段,都是你需要论证、保护并最终披露的字段,其中一些还在法律上高度敏感:种族、族裔、宗教、政治观点和健康数据属于 GDPR 下的特殊类别,附带额外义务。默认做法应当是取能回答你实际问题的最小集合。
对每个字段可以做一个有用的检验:沿这个维度的差异,是否有可能改变一个人标注你数据的方式,而你是否真的会去分析它?如果你标注的是冒犯性,POPQUORN 的结果让年龄、种族和受教育程度都站得住脚。如果你标注的是一个句子是否合乎语法,这些都不该出现在表单上。一个你永远不会去看的属性,是白白承担的风险。
有两项做法能让这件事保持诚实:
- 把每个问题绑定到一项分析上。 在某个字段进入表单之前,先写下你打算用它做的比较。没有比较,就没有这个字段。
- 让一切都可跳过。 敏感问题需要一个真正的"不愿回答"选项,而不是一个必填的单选按钮。一个感到被迫披露的人,要么退出,要么给你一个垃圾答案,两者都比留空更糟。
把知情同意做对
收集人口统计信息,是标注从数据工作变成涉及人类受试者研究的分界点。底线是知情同意:在任何人回答人口统计问题之前,他们应当知道你在收集什么、为什么收集、谁会看到,以及他们可以随时停止而不受惩罚。在实践中这意味着一个标注者在人口统计问题加载之前阅读并同意的页面,而不是埋在服务条款墙里的一个条款。
有几件事能让同意成为实质而非形式:
- 自愿参与,并由界面强制保障。 只有当拒绝很容易时,拒绝权才算数。每个敏感项都要有"不愿回答",并且要有一条不损失已挣报酬就能退出研究的途径。
- 自我申报,而非推断。 人口统计信息应当来自标注者本人,绝不能从姓名、位置或文字风格中猜测。推断出来的属性既经常出错,也比直接询问构成更严重的隐私侵犯。
- 匿名化存储。 把人口统计回答与任何能识别个人身份的信息分开。你要能说"自我认同为 X 的评分者给出的分数更高",同时无法指出那具体是哪一个人。
如果你在大学体系内工作,这通常需要与伦理审查委员会(IRB)沟通,而 IRB 关心的正是这些点。即便不在大学体系内,这些原则依然成立。
同意页面为人口统计问卷把关;每个敏感字段都可跳过,回答在标注开始前完成匿名化
标准化的人口统计量表
当你确实要收集某项人口统计信息时,措辞的重要性超出多数人的预期。临时拟定的问题会产生与别人对不上的类别,无法跨研究比较,而且在选项的框定上经常出问题,在性别和种族上尤其明显。解决办法是借用社会科学家已经打磨了几十年的工具:美国全国选举研究(ANES)或综合社会调查(GSS)的人口统计量表,提供了经过检验、站得住脚、且可与大量既有工作相比较的问题措辞与选项。
采用标准量表还替你完成了一部分伦理工作。这些工具本身就包含"不愿回答"选项,并且在如何处理敏感类别上经过审查,因此你不必重新发明一套可能被审查委员会挑出问题的选项。
收集之后要披露
收集了人口统计信息却再也不提,就失去了意义。收集这些数据的理由,是让你以及此后所有使用该数据集的人,都能看见标签是由谁产生的。这类披露有标准形式:数据声明(Bender 与 Friedman,2018)包含一个标注者人口统计章节,正是为了让下游使用者判断数据的泛化范围;数据集说明书(Gebru 等)对任何机器学习数据集提出同样的要求。在规划收集的同时就规划发布:只公布聚合分布、绝不公布个体记录,同时要有足够的细节让读者判断你的标注者群体是否类似于模型将要服务的人群。这一端我们在为标注数据集撰写文档中有专门讨论。
在 Potato 中怎么做
Potato 有一部分正是为此而建。POPQUORN 就是"Potato-Prolific"数据集,通过在 Prolific 上运行 Potato 研究收集而来,因此同意与人口统计流程是内建的,而不是后来拼上去的。
接入流程是一个多阶段工作流:一个为研究把关的 consent 阶段,然后是收集人口统计信息的 prestudy 阶段,最后才是标注本身。
phases:
consent:
enabled: true
data_file: "data/consent.json"
prestudy:
enabled: true
data_file: "data/demographics.json"
# annotation phase is always enabled同意页面是一个带 right_label 的问题,也就是继续所必须给出的答案。没有先同意,谁都到不了人口统计问卷或任务本身。
[
{
"name": "consent_agreement",
"type": "radio",
"description": "I have read the consent form, understand my responses are anonymized, and agree to participate. I may stop at any time.",
"labels": ["I agree", "I do not agree"],
"right_label": "I agree",
"required": true
}
]至于人口统计问题本身,给每个敏感问题配上"不愿回答"选项,并在那些不好处理的类别上使用内置模板:
[
{
"name": "age_range",
"type": "radio",
"description": "What is your age range?",
"labels": ["18-24", "25-34", "35-44", "45-54", "55+", "Prefer not to answer"]
},
{
"name": "ethnicity",
"type": "select",
"description": "Which best describes you? (optional)",
"template": "ethnicity",
"free_response": true,
"free_response_label": "Prefer to self-describe"
}
]如果你根本不想手写这些问题,Potato 附带了经过验证的问卷量表,其中包括八套标准化的人口统计量表。把 prestudy 阶段指向 ANES 或 GSS 的人口统计量表,就能免费获得经过检验的措辞:
phases:
prestudy:
type: prestudy
instrument: "anes-demographics" # or gss-demographics, acs-demographics, ...带同意流程的人口统计示例是这整套流程的可直接运行版本;如果你想测量的不止人口统计,经过验证的问卷量表介绍了更完整的量表库。
研究一旦跑起来,人口统计回答会与标签一并按标注者存储,这正是让你能做那项"当初据以论证收集必要性"的分析的前提:按群体拆解一致性,并检验某项人口统计特征是否像 POPQUORN 发现的那样能预测标签。Potato 会在标注上报告 Cohen's 与 Fleiss' kappa,因此你可以测量群体归属是否真的推动了标签,而不必靠猜。当你发布数据时,prestudy 阶段的聚合分布就是你数据声明中的标注者人口统计章节,早已收集完毕。
接下来读什么
- 分歧是信号而非噪声,讲的是为什么标签中的人口统计差异往往正是你想保留的东西。
- 为标注数据集撰写文档,讲如何把收集到的人口统计信息变成数据声明或数据集说明书。
- 标注者间一致性详解,讲你在按群体分析标签时所用的统计方法。
- 在 Prolific 和 MTurk 上开展众包研究,讲如何从一开始就招募到人口结构均衡的标注者群体。