Skip to content

Jeux de données et expériences

Constituez des jeux de données d'évaluation versionnés et lancez des expériences qui notent les sorties d'agent dans la durée. L'ossature d'évaluation de Potato — stockage fichier ou SQLite, versions étiquetées, splits, export SFT/DPO et comparaison d'expériences côte à côte avec deltas de régression.

Les jeux de données et les expériences forment l'ossature d'évaluation de Potato : des collections versionnées d'exemples d'évaluation, et des exécutions d'expériences qui les notent avec des évaluateurs programmatiques. Ensemble, ils font passer Potato de « annoter une fois » à « évaluer en continu » : constituez un jeu de test, lancez des évaluateurs et suivez les scores au fil des versions de prompt ou de modèle.

Activation

yaml
datasets:
  enabled: true
  storage: file   # "file" (default, git-diffable JSONL) | "sqlite"

Jeux de données

Un jeu de données est une collection nommée d'exemples (id, inputs, reference_outputs facultatif, metadata, split). Chaque ajout, mise à jour ou suppression crée une nouvelle version immuable (v0001, v0002, …) ; les versions peuvent être étiquetées (par exemple prod), et les lectures épinglent une version avec as_of (latest, une étiquette ou un identifiant de version).

Trois façons de constituer les exemples :

  • Depuis la tâche en coursImport loaded instances transforme les instances de la tâche en exemples.
  • Depuis les traces ingérées uniquementImport ingested traces (webhook / LangSmith / Langfuse).
  • Avec les annotations humaines comme références — agrège le label humain majoritaire par schéma dans les reference_outputs de chaque exemple.

Expériences

Une expérience exécute des évaluateurs sur une version d'un jeu de données et enregistre les résultats par exemple ainsi que les scores agrégés. Choisissez un jeu de données et des évaluateurs sur la page d'aperçu puis cliquez sur Run, ou utilisez POST /datasets/api/experiments/run. Sélectionnez deux expériences ou plus puis Compare pour voir les scores agrégés côte à côte, avec les deltas par rapport à la référence afin que les régressions ressortent.

Les évaluateurs LLM-juge appellent votre point de terminaison IA configuré et peuvent prendre du temps sur de grands jeux de données.

Export vers des données de fine-tuning

Toute version d'un jeu de données s'exporte en JSONL pour le fine-tuning :

  • SFT{"prompt": <inputs>, "completion": <reference_outputs>}
  • DPO{"prompt": <inputs>, "chosen": <reference_outputs>, "rejected": <metadata.rejected | outputs>}
bash
curl -OJ "http://localhost:8000/datasets/api/datasets/agent-eval-v1/export?format=sft"

API

Tous les points de terminaison exigent une authentification admin (en-tête X-API-Key ou session admin).

MéthodeCheminRôle
POST/datasets/api/datasetsCréer un jeu de données
POST/datasets/api/datasets/<name>/examplesAjouter des exemples (nouvelle version)
POST/datasets/api/datasets/<name>/tagÉtiqueter une version
GET/datasets/api/datasets/<name>/export?format=sft|dpoExporter en JSONL
POST/datasets/api/experiments/runLancer une expérience
GET/datasets/api/experimentsLister les expériences

L'API d'administration d'évaluation (/admin/eval/...) inspecte et pilote le processus d'annotation de ces tâches : état des jeux de données et des expériences, avancement de l'annotation par instance, décomptes de traces ingérées, et pause/reprise des attributions.

Pages liées