에이전트 평가
사람과 LLM 심판에 의한 에이전트 출력 평가: 심판 보정, 트레이스 검토, 트래젝터리 편집, 프로그램적 평가기, CI 평가.
이 섹션은 모델의 출력을 라벨링 대상이 아니라 검토 대상으로 다룹니다. 작업 단위는 대개 트레이스, 즉 에이전트의 한 번의 실행이며 도구 호출, 중간 단계, 최종 답변을 포함합니다.
LLM-as-Judge 캘리브레이션과 심사자 ↔ 사람 정렬은 모델이 채점하고 그것을 어디까지 신뢰할지 알아야 하는 경우를 다룹니다. 3패널 트레이스 평가 (eval_trace)는 사람이 채점하는 경우를 다룹니다. CI 평가은 둘 중 어느 쪽이든 커밋마다 실행하는 방법을 다룹니다.
Potato는 모델을 학습시키지 않습니다. 여기서 나오는 것은 라벨, 점수, 일치도 통계이며, 그 이후에 무엇을 할지는 이 도구 바깥의 일입니다.