Conjuntos de dados e experimentos
Construa conjuntos de dados de avaliação versionados e execute experimentos que pontuam as saídas do agente ao longo do tempo. A espinha dorsal de avaliação do Potato — armazenamento em arquivo ou SQLite, versões com tags, splits, exportação para SFT/DPO e comparação de experimentos lado a lado com deltas de regressão.
Conjuntos de dados e experimentos são a espinha dorsal de avaliação do Potato: coleções versionadas de exemplos de avaliação e execuções de experimentos que os pontuam com avaliadores programáticos. Juntos, eles transformam o Potato de "anotar uma vez" em "avaliar continuamente": monte um conjunto de teste, execute avaliadores e acompanhe as pontuações entre versões de prompt ou de modelo.
Habilitando
datasets:
enabled: true
storage: file # "file" (default, git-diffable JSONL) | "sqlite"Conjuntos de dados
Um conjunto de dados é uma coleção nomeada de exemplos (id, inputs, reference_outputs opcional, metadata, split). Cada adição/atualização/remoção cria uma nova versão imutável (v0001, v0002, …); as versões podem receber tags (por exemplo, prod), e as leituras fixam uma versão com as_of (latest, uma tag ou um id de versão).
Há três formas de curar exemplos:
- A partir da tarefa ativa — Import loaded instances converte as instâncias da tarefa em exemplos.
- Apenas a partir de rastros ingeridos — Import ingested traces (webhook / LangSmith / Langfuse).
- Com anotações humanas como referência — agrega o rótulo humano majoritário por esquema nos
reference_outputsde cada exemplo.
Experimentos
Um experimento executa avaliadores sobre uma versão de conjunto de dados e registra resultados por exemplo além das pontuações agregadas. Escolha um conjunto de dados e os avaliadores na página de visão geral e clique em Run, ou faça POST /datasets/api/experiments/run. Selecione dois ou mais experimentos e clique em Compare para ver as pontuações agregadas lado a lado, com deltas em relação à linha de base para que as regressões saltem aos olhos.
Avaliadores do tipo LLM-judge chamam o endpoint de IA configurado e podem demorar em conjuntos de dados grandes.
Exportação para dados de fine-tuning
Qualquer versão de conjunto de dados exporta para JSONL para fine-tuning:
- SFT —
{"prompt": <inputs>, "completion": <reference_outputs>} - DPO —
{"prompt": <inputs>, "chosen": <reference_outputs>, "rejected": <metadata.rejected | outputs>}
curl -OJ "http://localhost:8000/datasets/api/datasets/agent-eval-v1/export?format=sft"API
Todos os endpoints exigem autenticação de administrador (cabeçalho X-API-Key ou sessão de admin).
| Método | Caminho | Finalidade |
|---|---|---|
| POST | /datasets/api/datasets | Criar um conjunto de dados |
| POST | /datasets/api/datasets/<name>/examples | Adicionar exemplos (nova versão) |
| POST | /datasets/api/datasets/<name>/tag | Marcar uma versão com tag |
| GET | /datasets/api/datasets/<name>/export?format=sft|dpo | Exportar JSONL |
| POST | /datasets/api/experiments/run | Executar um experimento |
| GET | /datasets/api/experiments | Listar experimentos |
A API de administração de avaliação (/admin/eval/...) inspeciona e controla o processo de anotação dessas tarefas: status de conjuntos de dados/experimentos, progresso de anotação por instância, contagem de rastros ingeridos e pausa/retomada de atribuições.
Relacionados
- Referência completa no Read the Docs — API completa e detalhes de armazenamento, na versão correspondente
- Avaliadores programáticos
- Regras de automação — cure automaticamente os rastros recebidos em conjuntos de dados
- Curadoria semântica — encontre rastros para adicionar por similaridade