Skip to content

智能体评估

由人工与大模型评审对智能体输出进行评估:评审校准、轨迹审阅、轨迹编辑、程序化评估器与 CI 评估。

本节把模型的输出当作需要审阅的对象,而不是需要标注的对象。工作单元通常是一条轨迹:智能体的一次运行,包含其工具调用、中间步骤与最终答案。

LLM 作为评审者的校准评判员 ↔ 人工标注的一致性 针对由模型评分、而你需要知道该信任到什么程度的情况。三窗格轨迹评估 (eval_trace) 针对由人来评分的情况。CI 评估 讲如何在每次提交时运行其中任意一种。

Potato 不训练模型。本节产出的是标签、分数与一致性统计;之后如何使用这些结果,发生在本工具之外。