一致性抓不出走过场式的盖章
当标注者不读就接受模型预标注时,标注者间一致性反而会上升。所有从标注本身算出的质量指标都会变好。时间是唯一剩下的信号。
来自 Potato 团队的新闻、教程和更新。
当标注者不读就接受模型预标注时,标注者间一致性反而会上升。所有从标注本身算出的质量指标都会变好。时间是唯一剩下的信号。

Potato 现在可以记录标注者如何写出自由文本答案,而不记录他们键入的内容,并把停顿、修改和粘贴变成可审计的标记,指出哪些回答是粘贴来的而不是写出来的。
从一个 Whisper 输出目录一路走到带标签的说话人话轮:怎么选标注单元、怎么处理说话人分离、怎么写配置、怎么把任务跑起来,以及怎么在导出时保住时间对齐。



Get notified about new tutorials, releases, and community highlights.
多数投票把标注者告诉你的东西丢掉了大半。项目反应理论给每个标签一个后验概率和一段置信区间,估计标注者能力和条目难度,还能找出坏掉的标注手册条目,既不需要黄金标签,也不需要 LLM。
Potato 2.7 带来带误差范围的标签、实时规范化协作房间、反事实边界探针、同伴预测评分、本地语音理由记录、一条命令生成数据集报告,以及移动端标注,这些都不需要 LLM。此外还有多智能体与多模态智能体评测。

在 Potato 中对计算机操作与 GUI 智能体做人工评估的一次演练:评判每一个动作、在截图上检查点击落点,以及逐个审查工具调用。
如何用 Potato 找出一个多智能体 LLM 系统失败的原因:交互图、失败归因、交接审查、每个智能体的记分卡、工具争用时间线和涌现行为标记。

在智能体评估中,人工审查时间是最稀缺的资源。Potato 2.6 将基于信号的分流队列与评判者—人工对齐结合起来,让最糟糕的轨迹优先送达人工,并让你的 LLM 评判者持续变得更好。
在主观任务上,标注者的身份会影响标签,因此人口统计信息值得收集,但前提是取得同意并说明理由。该问什么、该放过什么,以及如何在 Potato 中跑通这套流程。



一份实用指南,帮你判断何时可以让 LLM 标注你的数据、模型标注员会在哪里失手,以及如何在 Potato 里把自动化与人工核验结合起来。
坦诚地探讨如何挑选开源数据标注工具、哪些问题才真正能缩小选择范围,以及在 Label Studio、Prodigy、Doccano、brat 和 Argilla 之中 Potato 处于什么位置。



Potato 现已支持编码智能体标注,具备差异渲染、终端输出展示和过程奖励方案。可导入 Claude Code、Aider 和 SWE-Agent 的轨迹。
用 Potato 收集逐步奖励信号、训练 PRM 的分步指南,涵盖首错模式、逐步标注,以及导出到训练流水线。




从 trace 渲染、逐步与多智能体标注、多模态智能体评审、编码智能体、实时观察、价格和自托管等方面,对比 Potato 与 LangSmith、Langfuse、Labelbox、Scale AI。
用 Potato 的 rubric_eval 搭建多准则评分量表评估:自定义准则、可配置的评分档位和维度权重,用于系统地评估 AI 智能体。


如何用 Potato 的网页智能体轨迹展示来评测自主网页浏览智能体,包含逐步截图、SVG 覆盖层和逐步标注方案。
Potato 2.2.0 新增 9 种标注方案、可插拔的导出系统、MACE 能力评估、55 个经过验证的调查量表以及远程数据源支持。


标注合同、法庭文件和监管申报的专业技术,需要领域专业知识。
使用 Potato 标准图像标注功能进行医学图像标注的最佳实践。




构建并排图像比较界面,用于偏好排名、A/B 测试和质量评估。
我们很高兴地宣布 Potato 2.0 发布,带来了 AI 驱动的功能、多媒体支持和主动学习能力。



使用 HTML 模板、CSS 样式和 JavaScript 交互创建自定义标注界面。
构建一个带有音频播放和 Likert 量表的语言学习标注任务,用于评估发音质量。




如何计算和解读 Cohen's Kappa、Fleiss' Kappa 和 Krippendorff's Alpha。
确保标注项目质量的最佳实践,包括可以在 Potato 内外实施的实用策略。



