Arena de modelos
Envie um prompt a N modelos lado a lado, compare as respostas e escolha a melhor para montar um placar de taxa de vitórias. Agnóstico a provedor — compare OpenAI, Anthropic, Ollama, vLLM e Gemini em uma única tela, gratuito e auto-hospedado.
A Arena de modelos envia um prompt a vários modelos lado a lado, permite comparar as respostas e escolher a melhor, e monta um placar de taxa de vitórias. Ela é agnóstica a provedor: cada modelo é construído pela fábrica de endpoints do Potato, então você pode comparar OpenAI, Anthropic, Ollama, vLLM, Gemini e OpenRouter na mesma tela.
Habilitando
arena:
enabled: true
models:
- {label: "GPT-4o", endpoint_type: openai, model: gpt-4o}
- {label: "Claude", endpoint_type: anthropic, model: claude-sonnet-4-6}
- {label: "Llama", endpoint_type: ollama, model: llama3.2, base_url: http://localhost:11434}Cada entrada corresponde a uma configuração de endpoint (endpoint_type, model, base_url, temperature, ai_config opcional para chaves/parâmetros). Quando habilitada, o painel de administração mostra um link Arena.
Como funciona
- Digite um prompt e ele é enviado a todos os modelos simultaneamente. Um modelo que falhe (chave inválida, provedor fora do ar) nunca bloqueia os demais; o cartão dele mostra o erro.
- As respostas aparecem lado a lado, cada uma com a latência do respectivo modelo.
- Clique em Pick as best para registrar uma preferência e atualizar o placar (vitórias, comparações e taxa de vitórias por modelo).
API
| Método | Caminho | Finalidade |
|---|---|---|
| POST | /admin/arena/api/run | {prompt} → respostas por modelo |
| POST | /admin/arena/api/preference | {prompt, winner, ranking?} → registrar uma escolha |
| GET | /admin/arena/api/leaderboard | taxa de vitórias por modelo |
curl -X POST localhost:8000/admin/arena/api/run -H "X-API-Key: <key>" \
-H "Content-Type: application/json" -d '{"prompt": "Explain RLHF in one sentence."}'Relacionados
- Referência completa no Read the Docs — configuração e API completas, na versão correspondente
- Conjuntos de dados e experimentos — para comparação offline em escala de conjunto de dados
- Comparação pareada — anote preferências A/B no fluxo principal