Skip to content

エージェント評価

人間と LLM ジャッジによるエージェント出力の評価:ジャッジ較正、トレース review、トラジェクトリ編集、プログラム評価器、CI 評価。

このセクションでは、モデルの出力をラベル付けの対象ではなくレビューの対象として扱います。作業単位は通常トレース、すなわちエージェントの 1 回の実行であり、ツール呼び出し、中間ステップ、最終回答を含みます。

LLM-as-Judge のキャリブレーションジャッジ ↔ 人間の整合性 は、採点をモデルが行い、それをどこまで信頼できるかを知る必要がある場合を扱います。3ペイン・トレース評価 (eval_trace) は人が採点する場合を扱います。CI 評価 はそのいずれかをコミットごとに実行する方法を扱います。

Potato はモデルを学習させません。ここで得られるのはラベル、スコア、一致度統計であり、その後どう使うかはこのツールの外側の話です。