Skip to content

智慧體評估

由人工與大模型評審對智慧體輸出進行評估:評審校準、軌跡審閱、軌跡編輯、程式化評估器與 CI 評估。

本節把模型的輸出當作需要審閱的物件,而不是需要標註的物件。工作單元通常是一條軌跡:智慧體的一次執行,包含其工具呼叫、中間步驟與最終答案。

LLM 作為評審者的校準評判員 ↔ 人工標註的一致性 針對由模型評分、而你需要知道該信任到什麼程度的情況。三窗格軌跡評估 (eval_trace) 針對由人來評分的情況。CI 評估 講如何在每次提交時執行其中任意一種。

Potato 不訓練模型。本節產出的是標籤、分數與一致性統計;之後如何使用這些結果,發生在本工具之外。