Skip to content

Datensätze & Experimente

Erstellen Sie versionierte Bewertungsdatensätze und führen Sie Experimente aus, die Agentenausgaben über die Zeit bewerten. Das Eval-Rückgrat von Potato — Datei- oder SQLite-Speicher, getaggte Versionen, Splits, SFT/DPO-Export und ein direkter Experimentvergleich mit Regressions-Deltas.

Datensätze & Experimente sind das Bewertungsrückgrat von Potato: versionierte Sammlungen von Bewertungsbeispielen sowie Experimentläufe, die sie mit programmatischen Evaluatoren bewerten. Zusammen machen sie aus Potato statt „einmal annotieren" ein „kontinuierlich bewerten": Kuratieren Sie ein Testset, führen Sie Evaluatoren aus und verfolgen Sie Punktzahlen über Prompt- oder Modellversionen hinweg.

Aktivieren

yaml
datasets:
  enabled: true
  storage: file   # "file" (default, git-diffable JSONL) | "sqlite"

Datensätze

Ein Datensatz ist eine benannte Sammlung von Beispielen (id, inputs, optional reference_outputs, metadata, split). Jedes Hinzufügen/Aktualisieren/Löschen erzeugt eine neue unveränderliche Version (v0001, v0002, …); Versionen können getaggt werden (z. B. prod), und Lesezugriffe fixieren eine Version über as_of (latest, ein Tag oder eine Versions-ID).

Beispiele lassen sich auf drei Arten kuratieren:

  • Aus der laufenden AufgabeImport loaded instances macht die Instanzen der Aufgabe zu Beispielen.
  • Nur aus aufgenommenen TracesImport ingested traces (Webhook / LangSmith / Langfuse).
  • Mit menschlichen Annotationen als Referenzen — aggregiert das Mehrheits-Label der Annotatoren pro Schema in die reference_outputs jedes Beispiels.

Experimente

Ein Experiment führt Evaluatoren gegen eine Datensatzversion aus und zeichnet Ergebnisse pro Beispiel sowie aggregierte Punktzahlen auf. Wählen Sie auf der Übersichtsseite einen Datensatz und Evaluatoren aus und klicken Sie auf Run, oder nutzen Sie POST /datasets/api/experiments/run. Wählen Sie zwei oder mehr Experimente aus und klicken Sie auf Compare, um die aggregierten Punktzahlen nebeneinander zu sehen, mit Deltas gegenüber der Baseline, sodass Regressionen sofort auffallen.

LLM-Judge-Evaluatoren rufen Ihren konfigurierten AI-Endpunkt auf und können bei großen Datensätzen eine Weile dauern.

Export als Fine-Tuning-Daten

Jede Datensatzversion lässt sich als JSONL für das Fine-Tuning exportieren:

  • SFT{"prompt": <inputs>, "completion": <reference_outputs>}
  • DPO{"prompt": <inputs>, "chosen": <reference_outputs>, "rejected": <metadata.rejected | outputs>}
bash
curl -OJ "http://localhost:8000/datasets/api/datasets/agent-eval-v1/export?format=sft"

API

Alle Endpunkte erfordern Admin-Authentifizierung (X-API-Key-Header oder Admin-Session).

MethodePfadZweck
POST/datasets/api/datasetsDatensatz anlegen
POST/datasets/api/datasets/<name>/examplesBeispiele hinzufügen (neue Version)
POST/datasets/api/datasets/<name>/tagVersion taggen
GET/datasets/api/datasets/<name>/export?format=sft|dpoJSONL exportieren
POST/datasets/api/experiments/runExperiment ausführen
GET/datasets/api/experimentsExperimente auflisten

Die Eval-Admin-API (/admin/eval/...) inspiziert und steuert den Annotationsprozess dieser Aufgaben: Datensatz-/Experimentstatus, Annotationsfortschritt pro Instanz, Zähler aufgenommener Traces sowie das Pausieren/Fortsetzen der Zuweisung.

Verwandte Themen