Skip to content

Conjuntos de dados e experimentos

Construa conjuntos de dados de avaliação versionados e execute experimentos que pontuam as saídas do agente ao longo do tempo. A espinha dorsal de avaliação do Potato — armazenamento em arquivo ou SQLite, versões com tags, splits, exportação para SFT/DPO e comparação de experimentos lado a lado com deltas de regressão.

Conjuntos de dados e experimentos são a espinha dorsal de avaliação do Potato: coleções versionadas de exemplos de avaliação e execuções de experimentos que os pontuam com avaliadores programáticos. Juntos, eles transformam o Potato de "anotar uma vez" em "avaliar continuamente": monte um conjunto de teste, execute avaliadores e acompanhe as pontuações entre versões de prompt ou de modelo.

Habilitando

yaml
datasets:
  enabled: true
  storage: file   # "file" (default, git-diffable JSONL) | "sqlite"

Conjuntos de dados

Um conjunto de dados é uma coleção nomeada de exemplos (id, inputs, reference_outputs opcional, metadata, split). Cada adição/atualização/remoção cria uma nova versão imutável (v0001, v0002, …); as versões podem receber tags (por exemplo, prod), e as leituras fixam uma versão com as_of (latest, uma tag ou um id de versão).

Há três formas de curar exemplos:

  • A partir da tarefa ativaImport loaded instances converte as instâncias da tarefa em exemplos.
  • Apenas a partir de rastros ingeridosImport ingested traces (webhook / LangSmith / Langfuse).
  • Com anotações humanas como referência — agrega o rótulo humano majoritário por esquema nos reference_outputs de cada exemplo.

Experimentos

Um experimento executa avaliadores sobre uma versão de conjunto de dados e registra resultados por exemplo além das pontuações agregadas. Escolha um conjunto de dados e os avaliadores na página de visão geral e clique em Run, ou faça POST /datasets/api/experiments/run. Selecione dois ou mais experimentos e clique em Compare para ver as pontuações agregadas lado a lado, com deltas em relação à linha de base para que as regressões saltem aos olhos.

Avaliadores do tipo LLM-judge chamam o endpoint de IA configurado e podem demorar em conjuntos de dados grandes.

Exportação para dados de fine-tuning

Qualquer versão de conjunto de dados exporta para JSONL para fine-tuning:

  • SFT{"prompt": <inputs>, "completion": <reference_outputs>}
  • DPO{"prompt": <inputs>, "chosen": <reference_outputs>, "rejected": <metadata.rejected | outputs>}
bash
curl -OJ "http://localhost:8000/datasets/api/datasets/agent-eval-v1/export?format=sft"

API

Todos os endpoints exigem autenticação de administrador (cabeçalho X-API-Key ou sessão de admin).

MétodoCaminhoFinalidade
POST/datasets/api/datasetsCriar um conjunto de dados
POST/datasets/api/datasets/<name>/examplesAdicionar exemplos (nova versão)
POST/datasets/api/datasets/<name>/tagMarcar uma versão com tag
GET/datasets/api/datasets/<name>/export?format=sft|dpoExportar JSONL
POST/datasets/api/experiments/runExecutar um experimento
GET/datasets/api/experimentsListar experimentos

A API de administração de avaliação (/admin/eval/...) inspeciona e controla o processo de anotação dessas tarefas: status de conjuntos de dados/experimentos, progresso de anotação por instância, contagem de rastros ingeridos e pausa/retomada de atribuições.

Relacionados