Skip to content
Announcements1 min read

Potato 2.7:测量标签是怎么产生的

Potato 2.7 带来带误差范围的标签、实时规范化协作房间、反事实边界探针、同伴预测评分、本地语音理由记录、一条命令生成数据集报告,以及移动端标注,这些都不需要 LLM。此外还有多智能体与多模态智能体评测。

Potato Team

标注工具的工作是收集标签。这一直是它的本职,Potato 从 2022 年起也一直在做。但标签是一个决策的产物,而在过去十年的大部分时间里,决策本身是不可见的:你拿到的是答案,而不是产生它的推理、信心或分歧。

Potato 2.7 建立在一个想法之上:标注工具应当测量判断是怎么做出来的,而不只是记录它们是什么。这一点对两种评审都成立:做标注的人,和被评测的 AI 模型。

Potato 2.7:测量标签是怎么产生的,无论评审是人还是模型Potato 2.7

带误差范围的标签

心理测量引擎会在标注陆续到达的过程中拟合一个项目反应理论模型,仅凭一致性的分布模式就能估计出每位标注者的能力和每条数据的难度。不需要黄金标签,也不需要 LLM。

导出结果不再是 sarcastic(3 票中的 2 票),而是 sarcastic, p = 0.94 [0.88 – 0.97]。这个概率衡量的是投了票,而不只是有多少人投票。

yaml
assignment_strategy: psychometric
psychometrics:
  enabled: true
  confidence_threshold: 0.95   # items above this stop consuming budget

从这个模型里会自然掉出两样东西。后验已经足够确定的数据不再被分发,冗余标注就流向真正需要它的地方。而当一条数据的区分度变成负值——也就是你最好的标注者恰恰是与大多数人意见相左的那些人——问题通常出在标注指南,而不是标注者。面板会把它标记为疑似码本缺陷。

校准会议

每个标注团队都会开规范化会议,而这些会议几乎总是通过屏幕共享进行,结论留在某个人的笔记里。多人协作房间把这样的会议搬进 Potato 并加以记录。

所有人先盲投。主持人揭晓结果。大家开始争论。任何人都可以改票,而揭晓之后的每一次改动都会对照当时的多数意见记录下来,形成一份逐人的从众记录。一个实时的 Krippendorff's α 指标会同时在盲投和当前投票上运行,两者之间的差距就说明了这场讨论的价值——而且是在讨论进行时就能看到。

碰头房间会自动从团队当前存在分歧的数据中取样。旁观房间则让新人观摩资深标注者如何工作,连高亮操作都能看到。

没有黄金标签的质量控制

有两项功能从不同方向攻击同一个问题,而且都不需要埋入伪造的题目。

Truth Serum 在每次打标之后追问一个问题:你认为有百分之多少的其他标注者会选择和你一样的答案?这些预测会喂给"出人意料地流行"估计量(Prelec、Seung & McCoy 2017Nature),在标注困难时它优于多数投票:也就是自信的大多数判错、而掌握信息的少数判对的场合。据我们所知,Potato 是第一个提供同伴预测评分的标注工具。

Boundary Lab 在一个标签落定之后立刻展示一处最小的反事实改写,并询问该标签是否依然成立。回答只需一次点击,普通的标注流程就顺带产出了对比集(Gardner 等 2020)。有些探针是保义改写,如果标注者在这类探针上翻转了答案,那就说明这个标签原本并没有跟着语义走——而这一切不需要埋入任何一条黄金数据。

逐字记录的人类推理

Think-Aloud 模式让标注者一边工作一边讲述。语音转文字通过 faster-whisper 在本地运行,因此没有任何数据离开这台机器,也不产生按 token 计费的成本。转写稿逐字保存,并刻意不做摘要,因为对出声思考记录做转述,会毁掉你原本想采集的那件东西。

它记录的是如何推理到一个标签,与切分模型推理过程的过程奖励工具正好构成一对。同一条数据,两条思维链。

Paper 模式与 Pocket 模式

Paper 模式用一条命令把一个项目变成可编译的 LaTeX 数据集报告:标签分布、标注者表格、带正确引用的一致性统计、耗时数据,以及一段带真实数字的局限性说明。

bash
python -m potato.paper config.yaml -o paper_export

Pocket 模式为移动端标注提供了真正可用的界面:触屏设备会得到可滑动的卡片堆,按钮落在拇指可及的区域,并支持离线同步。那些确实需要桌面端的任务(区间、边界框、视频)不会被硬塞进手机,而是会给出提示。

评测 AI 智能体

2.7 的另一半把同样的理念对准了模型。智能体评测套件现在会把一次多智能体运行当作一个团队来标注,而不是一份扁平的对话记录:可点击的交互图、跨智能体的失败归因、交接审查、逐智能体与全队的评分卡、工具争用时间线,以及跨智能体的涌现行为打标。

多模态智能体有自己的专属界面:带点击落点定位的 GUI 与计算机操作轨迹、带插话检测的全双工语音时间线、带实时 IoU 的视频时间定位,以及文档表格结构。

如果你想看的是完整走查而不是清单,我们写过一篇关于排查多智能体系统故障的文章。

两半在哪里汇合

它们是同一个想法对准了两种不同的评审,而 2.7 把它们接了起来。

Think-Aloud 记录人如何推理到一个标签。过程奖励标注逐步捕捉模型如何推理。把它们并排放在同一条数据上,你就能看出人与机器的判断在哪里分道扬镳。

而一个 LLM 评审的可信度,上限就是你用来验证它的那批人工标签的可信度。评审—人类对齐面板告诉你评审与人的一致程度;心理测量和 Truth Serum 则给这些人的标签配上置信区间。"评审与人类一致"于是成了一个带区间的主张。

其余更新

跨文档事件标注、对话与轨迹上的话轮级标注、带整页编辑器的活文档式码本、可选 OCR 的 PDF 跨页链接、带分组模式的 RBAC 角色,以及支持十种语言的管理端与标注端面板。

安装也变轻了。AI SDK 现在改为延迟加载,因此一条普通的 pip install potato-annotation 完全不会拉入任何 AI SDK,启动时间也从大约 2.0 秒降到 0.7 秒。

如何获取

bash
pip install --upgrade potato-annotation

Potato 免费、以 GPL-3.0-or-later 开源,可自行部署。上面这七项功能都是选择性启用的、与任务无关的,且没有一项需要 LLM。如果你的数据不能离开所在机构,或者你的预算撑不起按 token 计费的账单,这一点就很重要。

Potato 2.0 发表于 ACL 2026(系统演示专场)。如果 Potato 对你的研究有帮助,引用这篇论文即可。

可以从快速开始入手,浏览新特性,或者读一读带误差范围的标签没有黄金标签时的质量控制这两篇深入文章。