Skip to content

Agentenevaluation

Bewertung von Agentenausgaben durch Menschen und LLM-Judges: Judge-Kalibrierung, Trace-Review, Trajektorienbearbeitung, programmatische Evaluatoren und CI-Evaluation.

Dieser Abschnitt behandelt die Ausgabe eines Modells als etwas, das geprüft und nicht gelabelt wird. Die Arbeitseinheit ist meist ein Trace: ein Lauf eines Agenten mit seinen Werkzeugaufrufen, Zwischenschritten und der endgültigen Antwort.

Kalibrierung von LLM-as-Judge und Übereinstimmung Judge ↔ Mensch behandeln den Fall, dass ein Modell bewertet und Sie wissen müssen, wie weit Sie ihm trauen können. Drei-Fenster-Trace-Bewertung (eval_trace) behandelt den Fall, dass ein Mensch bewertet. CI-Bewertung behandelt, wie Sie eines von beiden bei jedem Commit ausführen.

Potato trainiert keine Modelle. Alles hier erzeugt Labels, Scores und Übereinstimmungsstatistiken; was Sie danach damit tun, geschieht außerhalb des Werkzeugs.