Avaliação de agentes
Avaliação de saídas de agentes por pessoas e por juízes LLM: calibração do juiz, revisão de rastros, edição de trajetórias, avaliadores programáticos e avaliação em CI.
Esta seção trata a saída de um modelo como algo a ser revisado, não rotulado. A unidade de trabalho costuma ser um rastro: uma execução de um agente, com suas chamadas de ferramenta, passos intermediários e resposta final.
Calibração de LLM como juiz e Alinhamento juiz ↔ humano cobrem o caso em que quem avalia é um modelo e você precisa saber até onde confiar. Avaliação de rastro em três painéis (eval_trace) cobre o caso em que quem avalia é uma pessoa. Avaliação em CI cobre rodar qualquer um dos dois a cada commit.
O Potato não treina modelos. Tudo aqui produz rótulos, pontuações e estatísticas de concordância; o que você faz com eles depois acontece fora da ferramenta.