Évaluation d'agents
Évaluation des sorties d'agents par des humains et des juges LLM : calibration du juge, revue de traces, édition de trajectoires, évaluateurs programmatiques et CI.
Cette section traite la sortie d'un modèle comme quelque chose à relire, pas à étiqueter. L'unité de travail est le plus souvent une trace : une exécution d'un agent, avec ses appels d'outils, ses étapes intermédiaires et sa réponse finale.
Calibration du LLM juge et Alignement juge ↔ humain couvrent le cas où la notation est faite par un modèle et où vous devez savoir jusqu'où lui faire confiance. Évaluation de trace à trois volets (eval_trace) couvre le cas où elle est faite par une personne. Évaluation en CI couvre l'exécution de l'une ou l'autre à chaque commit.
Potato n'entraîne pas de modèles. Tout ce qui est produit ici, ce sont des étiquettes, des scores et des statistiques d'accord ; ce que vous en faites ensuite se passe en dehors de l'outil.