Skip to content
Guides1 min read

评审谁来评:把人和模型的推理并排放

LLM 评审的可信度,取决于你用来验证它的那批人工标签。把人的思维过程和模型的思维过程放在同一条数据上并排比较,并用带置信区间的标签来检验你的评审。

Potato Team

做大规模 LLM 评测的人,最后都会用 LLM 来当评审;而所有人最后都会问,这个评审能不能信。通常的答案是拿人工标签来对照。可这个对照的质量取决于人工标签本身,而当标注者彼此意见不一、又没人记录分歧有多大时,"评审与人类一致"就是一个很弱的结论。

Potato 2.7 围绕一个想法组织起来:标注工具应当测量一个判断是怎么做出来的,而不只是把结果记下来。这一点对两种评审都成立。

验证评审时的问题出在哪

标准流程本身是合理的。你有一批大到无法手工标注的数据,于是用提示词让模型去打分。在信任这些分数之前,你抽一个样本交给人工标注,再测量评审与人工之间的一致性。如果 Cohen's κ 足够高,就可以上线。

薄弱环节在最后一步。那个 κ 是把你的评审与某一个人工标签作比较,而这个标签通常是两三位标注者的多数投票结果。多数投票是一个没有误差范围的点估计。无论三个人是当即一致,还是两人在长时间争论后压过了第三人,它给出的"讽刺"都带着完全相同的确定性。

所以当你报告评审与人类的一致性达到 κ = 0.71 时,你是在报告与一个自身不确定性从未被测量过的数字之间的一致性。如果人工标签在困难样本上接近抛硬币,那么这些样本上的 κ 测的主要是噪声,再怎么调提示词也推不动它。

我们此前写过评审校准评审与人类的对齐的机制。2.7 补上的是另一半:让这场比较中的人类那一侧也带上自己的不确定性。

先给人工标签配上误差范围

心理测量引擎会在你的人工标注上拟合一个项目反应理论模型,把每个标签报告为带区间的后验(sarcastic, p = 0.94 [0.88 – 0.97]),衡量的是投了票,而不只是有多少人投票。

Truth Serum 再加上同伴预测评分,把那些群体虽然自信、但很可能判错的样本标记出来。

这样一来,评审对比的形态就变了。你不再只能说

评审在 71% 的样本上与多数标签一致

而是可以说

在人工标签明确的样本上(p > 0.9),评审与人类后验的一致率为 94%;在不明确的样本上为 52%。而后者占全部样本的 18%。

第二种说法是可以据以行动的,第一种不是。它告诉你评审在简单样本上没问题、在困难样本上不可靠,同时告诉你困难样本占多大比例。它还意味着,在真正有歧义的样本上可能根本不存在供评审去符合的真值,在那里追求更高的 κ 就是在追噪声。

这正是评审—人类对齐面板的用途,也是人类过程类功能和智能体评测类功能出现在同一个版本、而不是分成两个版本的原因。

同一条数据上的两条思维链

比较的另一半是推理过程本身。

Think-Aloud 模式记录是如何推理到一个标签的。标注者一边工作一边讲述;语音转文字在本地运行;转写稿逐字保存、不做摘要,因为对出声思考记录做转述,恰恰会毁掉你想采集的东西。

带有检测到的语音标签的逐字口述推理转写稿逐字记录的人类思维链

过程奖励标注记录模型是如何推理的。模型的思维链被切分成步骤,每一步给出好/坏/中性的奖励信号,这就是过程奖励模型的训练信号。

yaml
annotation_schemes:
  - annotation_type: process_reward
    name: cot_review
    description: "Rate each step of the model's reasoning."
    steps_key: reasoning_steps

同一条数据,两条思维链,并排摆着。

这样对比能看出什么

最直接的用途是找出模型与人推理方式不同的地方。

只看最终答案的评分,无法区分"因为正确的理由得出正确答案的模型"和"因为错误的理由得出正确答案的模型"。在一个讽刺识别任务里,人可能会说:"关键在那句 'thanks so much'。没人会为迟到两天这么用力地道谢。" 而模型可能只因为文本里有一个感叹号就落到同一个标签上。两者都会被判为正确,但只有一个能泛化。

标签看不出这一点,推理过程可以,这就是把两者都采集下来值得费这个事的原因。

第二个用途是训练数据。人的推理与模型的推理出现分歧的那些步骤,几乎按定义就是过程奖励数据集中信号最强的步骤。它们正是模型的过程出了错、而输出却看不出来的地方。

一个限制。 Potato 提供两种采集界面并把它们并排展示,但它不会自动计算人类思维链与模型思维链之间的相似度指标,我们也刻意没有做这样一个指标。"这两条推理轨迹是一致的"究竟意味着什么,仍是一个开放的研究问题;我们自己编一个数出来会比没有数更糟,因为它看上去很权威,实际上说明不了什么。你拿到的是成对的轨迹,指标由你来定义。

把它们串起来

2.7 中一条站得住脚的评测流水线大致是这样的。

  1. 先用人工标注一个样本,并开启心理测量。每个标签都会得到一个后验和一个区间。有歧义的样本会被识别为有歧义,而不是被悄悄误标。
  2. 运行 Truth Serum,抓出那些群体自信但很可能判错的样本。
  3. 修订标注指南,重点是码本缺陷检测器标出负区分度的地方;最好在规范化协作房间里做,这样你能一边收敛一边看着一致性变化。
  4. 用这批标签校准评审,并按人类置信度分层报告对齐情况,而不是给出单一的数字。
  5. 在评审与人类判断不一致的样本上,检查推理而不只是结论。

每一步都用 YAML 配置、自托管、免费。第 1 到 3 步完全不需要 LLM。

这些都不足以让一个 LLM 评审本身变得可信。它们让可信这个主张变得可以核验:一个带区间的结论,对照同样带区间的人工标签,落在难度可被描述的样本上。这个标准比"我们的评审与人类价值观对齐"要低,但更有用。

延伸阅读