エージェント評価
人間と LLM ジャッジによるエージェント出力の評価:ジャッジ較正、トレース review、トラジェクトリ編集、プログラム評価器、CI 評価。
このセクションでは、モデルの出力をラベル付けの対象ではなくレビューの対象として扱います。作業単位は通常トレース、すなわちエージェントの 1 回の実行であり、ツール呼び出し、中間ステップ、最終回答を含みます。
LLM-as-Judge のキャリブレーション と ジャッジ ↔ 人間の整合性 は、採点をモデルが行い、それをどこまで信頼できるかを知る必要がある場合を扱います。3ペイン・トレース評価 (eval_trace) は人が採点する場合を扱います。CI 評価 はそのいずれかをコミットごとに実行する方法を扱います。
Potato はモデルを学習させません。ここで得られるのはラベル、スコア、一致度統計であり、その後どう使うかはこのツールの外側の話です。