Live Agent Evaluation
Wie du einen KI-Agenten in Echtzeit evaluierst: anhalten, Anweisungen schicken, übernehmen, zurückspulen und verzweigen, mit der Live-Agenten-Anzeige von Potato.
Die meiste Agenten-Evaluation sieht sich einen aufgezeichneten Trace an. Live-Evaluation schaut einem Agenten beim Laufen zu und lässt einen Menschen eingreifen: anhalten, Anweisungen schicken, die Kontrolle übernehmen oder zu einem früheren Punkt zurückspulen und einen anderen Weg versuchen. Für Human-in-the-Loop-Evaluation auf dem eigenen Server ist Potato ein Open-Source-Werkzeug, das festhält, was eine Aufzeichnung nicht hergibt: an welcher Stelle ein Mensch eingegriffen hätte und wie bessere Anleitung aussieht.
Die Feature-Referenz steht unter Live-Evaluation von Agenten und Live Coding Agent.
Was bringt Live Agent Evaluation zusätzlich?
- Anhalten und fortsetzen: den Agenten mitten in der Aufgabe stoppen und seinen Zustand prüfen.
- Anweisungen schicken: ihm einen Hinweis geben und beobachten, wie er sich darauf einstellt.
- Übernehmen: selbst steuern und danach die Kontrolle zurückgeben. Die Übergabepunkte sind wertvolle Labels.
- Zurückspulen und verzweigen: zu einem früheren Schritt zurückgehen und eine Alternative ausprobieren, um beide Wege aus demselben Zustand zu vergleichen.
Daraus entstehen interventionelle Daten, also Kontrafaktisches darüber, was hilft, und nicht nur beobachtende Labels.
Wie richte ich Live Agent Evaluation in Potato ein?
Der Live-Modus verbindet Potato über einen Endpunkt mit einem laufenden Agenten (ein OpenAI-kompatibler Proxy, ein eigener HTTP-Endpunkt oder ein Coding-Agent-Backend). Die annotierende Person arbeitet über die Live-Agenten-Anzeige.
live_agent:
endpoint_type: anthropic_vision # or coding_agent, openai_proxy, ...
ai_config:
model: claude-sonnet-4-20250514
api_key: ${ANTHROPIC_API_KEY}
max_steps: 30
allow_takeover: true
allow_instructions: trueWann lohnt sich Live Agent Evaluation?
- Richtlinien entwickeln: beim Zusehen zeigen sich die Fehlerarten, die es wert sind, in eine Taxonomie für das spätere Labeln in Serie aufgenommen zu werden.
- Interaktive Aufgaben: Chat-Assistenten und Agenten mit Tool-Zugriff, bei denen die Interaktion das Beurteilte ist und nicht bloß das Transkript.
- Stresstests: prüfen, wie ein Agent sich nach einem Hinweis oder einem erzwungenen Umweg wieder fängt.
Live-Evaluation ist aufwendiger und liefert weniger Durchsatz als die Durchsicht aufgezeichneter Traces, taugt also vor allem für eine kleine, gezielte Stichprobe oder für den Entwurf der Serienaufgabe. Für Menge wechselst du zum Annotieren von Agenten-Trajektorien über aufgezeichnete Läufe.