Datensätze & Experimente
Erstellen Sie versionierte Bewertungsdatensätze und führen Sie Experimente aus, die Agentenausgaben über die Zeit bewerten. Das Eval-Rückgrat von Potato — Datei- oder SQLite-Speicher, getaggte Versionen, Splits, SFT/DPO-Export und ein direkter Experimentvergleich mit Regressions-Deltas.
Datensätze & Experimente sind das Bewertungsrückgrat von Potato: versionierte Sammlungen von Bewertungsbeispielen sowie Experimentläufe, die sie mit programmatischen Evaluatoren bewerten. Zusammen machen sie aus Potato statt „einmal annotieren" ein „kontinuierlich bewerten": Kuratieren Sie ein Testset, führen Sie Evaluatoren aus und verfolgen Sie Punktzahlen über Prompt- oder Modellversionen hinweg.
Aktivieren
datasets:
enabled: true
storage: file # "file" (default, git-diffable JSONL) | "sqlite"Datensätze
Ein Datensatz ist eine benannte Sammlung von Beispielen (id, inputs, optional reference_outputs, metadata, split). Jedes Hinzufügen/Aktualisieren/Löschen erzeugt eine neue unveränderliche Version (v0001, v0002, …); Versionen können getaggt werden (z. B. prod), und Lesezugriffe fixieren eine Version über as_of (latest, ein Tag oder eine Versions-ID).
Beispiele lassen sich auf drei Arten kuratieren:
- Aus der laufenden Aufgabe — Import loaded instances macht die Instanzen der Aufgabe zu Beispielen.
- Nur aus aufgenommenen Traces — Import ingested traces (Webhook / LangSmith / Langfuse).
- Mit menschlichen Annotationen als Referenzen — aggregiert das Mehrheits-Label der Annotatoren pro Schema in die
reference_outputsjedes Beispiels.
Experimente
Ein Experiment führt Evaluatoren gegen eine Datensatzversion aus und zeichnet Ergebnisse pro Beispiel sowie aggregierte Punktzahlen auf. Wählen Sie auf der Übersichtsseite einen Datensatz und Evaluatoren aus und klicken Sie auf Run, oder nutzen Sie POST /datasets/api/experiments/run. Wählen Sie zwei oder mehr Experimente aus und klicken Sie auf Compare, um die aggregierten Punktzahlen nebeneinander zu sehen, mit Deltas gegenüber der Baseline, sodass Regressionen sofort auffallen.
LLM-Judge-Evaluatoren rufen Ihren konfigurierten AI-Endpunkt auf und können bei großen Datensätzen eine Weile dauern.
Export als Fine-Tuning-Daten
Jede Datensatzversion lässt sich als JSONL für das Fine-Tuning exportieren:
- SFT —
{"prompt": <inputs>, "completion": <reference_outputs>} - DPO —
{"prompt": <inputs>, "chosen": <reference_outputs>, "rejected": <metadata.rejected | outputs>}
curl -OJ "http://localhost:8000/datasets/api/datasets/agent-eval-v1/export?format=sft"API
Alle Endpunkte erfordern Admin-Authentifizierung (X-API-Key-Header oder Admin-Session).
| Methode | Pfad | Zweck |
|---|---|---|
| POST | /datasets/api/datasets | Datensatz anlegen |
| POST | /datasets/api/datasets/<name>/examples | Beispiele hinzufügen (neue Version) |
| POST | /datasets/api/datasets/<name>/tag | Version taggen |
| GET | /datasets/api/datasets/<name>/export?format=sft|dpo | JSONL exportieren |
| POST | /datasets/api/experiments/run | Experiment ausführen |
| GET | /datasets/api/experiments | Experimente auflisten |
Die Eval-Admin-API (/admin/eval/...) inspiziert und steuert den Annotationsprozess dieser Aufgaben: Datensatz-/Experimentstatus, Annotationsfortschritt pro Instanz, Zähler aufgenommener Traces sowie das Pausieren/Fortsetzen der Zuweisung.
Verwandte Themen
- Vollständige Referenz auf Read the Docs — vollständige API- und Speicherdetails, versionsgenau
- Programmatische Evaluatoren
- Automatisierungsregeln — eingehende Traces automatisch in Datensätze kuratieren
- Semantische Kuratierung — hinzuzufügende Traces per Ähnlichkeit finden