Jeux de données et expériences
Constituez des jeux de données d'évaluation versionnés et lancez des expériences qui notent les sorties d'agent dans la durée. L'ossature d'évaluation de Potato — stockage fichier ou SQLite, versions étiquetées, splits, export SFT/DPO et comparaison d'expériences côte à côte avec deltas de régression.
Les jeux de données et les expériences forment l'ossature d'évaluation de Potato : des collections versionnées d'exemples d'évaluation, et des exécutions d'expériences qui les notent avec des évaluateurs programmatiques. Ensemble, ils font passer Potato de « annoter une fois » à « évaluer en continu » : constituez un jeu de test, lancez des évaluateurs et suivez les scores au fil des versions de prompt ou de modèle.
Activation
datasets:
enabled: true
storage: file # "file" (default, git-diffable JSONL) | "sqlite"Jeux de données
Un jeu de données est une collection nommée d'exemples (id, inputs, reference_outputs facultatif, metadata, split). Chaque ajout, mise à jour ou suppression crée une nouvelle version immuable (v0001, v0002, …) ; les versions peuvent être étiquetées (par exemple prod), et les lectures épinglent une version avec as_of (latest, une étiquette ou un identifiant de version).
Trois façons de constituer les exemples :
- Depuis la tâche en cours — Import loaded instances transforme les instances de la tâche en exemples.
- Depuis les traces ingérées uniquement — Import ingested traces (webhook / LangSmith / Langfuse).
- Avec les annotations humaines comme références — agrège le label humain majoritaire par schéma dans les
reference_outputsde chaque exemple.
Expériences
Une expérience exécute des évaluateurs sur une version d'un jeu de données et enregistre les résultats par exemple ainsi que les scores agrégés. Choisissez un jeu de données et des évaluateurs sur la page d'aperçu puis cliquez sur Run, ou utilisez POST /datasets/api/experiments/run. Sélectionnez deux expériences ou plus puis Compare pour voir les scores agrégés côte à côte, avec les deltas par rapport à la référence afin que les régressions ressortent.
Les évaluateurs LLM-juge appellent votre point de terminaison IA configuré et peuvent prendre du temps sur de grands jeux de données.
Export vers des données de fine-tuning
Toute version d'un jeu de données s'exporte en JSONL pour le fine-tuning :
- SFT —
{"prompt": <inputs>, "completion": <reference_outputs>} - DPO —
{"prompt": <inputs>, "chosen": <reference_outputs>, "rejected": <metadata.rejected | outputs>}
curl -OJ "http://localhost:8000/datasets/api/datasets/agent-eval-v1/export?format=sft"API
Tous les points de terminaison exigent une authentification admin (en-tête X-API-Key ou session admin).
| Méthode | Chemin | Rôle |
|---|---|---|
| POST | /datasets/api/datasets | Créer un jeu de données |
| POST | /datasets/api/datasets/<name>/examples | Ajouter des exemples (nouvelle version) |
| POST | /datasets/api/datasets/<name>/tag | Étiqueter une version |
| GET | /datasets/api/datasets/<name>/export?format=sft|dpo | Exporter en JSONL |
| POST | /datasets/api/experiments/run | Lancer une expérience |
| GET | /datasets/api/experiments | Lister les expériences |
L'API d'administration d'évaluation (/admin/eval/...) inspecte et pilote le processus d'annotation de ces tâches : état des jeux de données et des expériences, avancement de l'annotation par instance, décomptes de traces ingérées, et pause/reprise des attributions.
Pages liées
- Référence complète sur Read the Docs — API complète et détails de stockage, alignée sur la version
- Évaluateurs programmatiques
- Règles d'automatisation — ajouter automatiquement les traces entrantes aux jeux de données
- Curation sémantique — trouver par similarité des traces à ajouter