Model Arena
Envía un mismo prompt a N modelos en paralelo, compara sus respuestas y elige la mejor para construir una tabla de clasificación por tasa de victorias. Independiente del proveedor: compara OpenAI, Anthropic, Ollama, vLLM y Gemini en una sola vista, gratis y autoalojado.
El Model Arena envía un mismo prompt a varios modelos en paralelo, te permite comparar las respuestas y elegir la mejor, y construye una tabla de clasificación por tasa de victorias. Es independiente del proveedor: cada modelo se construye a través de la fábrica de endpoints de Potato, así que puedes comparar OpenAI, Anthropic, Ollama, vLLM, Gemini y OpenRouter en la misma vista.
Activación
arena:
enabled: true
models:
- {label: "GPT-4o", endpoint_type: openai, model: gpt-4o}
- {label: "Claude", endpoint_type: anthropic, model: claude-sonnet-4-6}
- {label: "Llama", endpoint_type: ollama, model: llama3.2, base_url: http://localhost:11434}Cada entrada se corresponde con una configuración de endpoint (endpoint_type, model, base_url, temperature, ai_config opcional para claves y parámetros). Cuando está activado, el panel de administración muestra un enlace Arena.
Cómo funciona
- Introduce un prompt y se envía a todos los modelos de forma concurrente. Que un modelo falle (clave incorrecta, proveedor caído) nunca bloquea a los demás; su tarjeta muestra el error.
- Las respuestas se muestran lado a lado, cada una con la latencia por modelo.
- Haz clic en Pick as best para registrar una preferencia y actualizar la tabla de clasificación (victorias, comparaciones y tasa de victorias por modelo).
API
| Método | Ruta | Propósito |
|---|---|---|
| POST | /admin/arena/api/run | {prompt} → respuestas por modelo |
| POST | /admin/arena/api/preference | {prompt, winner, ranking?} → registrar una elección |
| GET | /admin/arena/api/leaderboard | tasa de victorias por modelo |
curl -X POST localhost:8000/admin/arena/api/run -H "X-API-Key: <key>" \
-H "Content-Type: application/json" -d '{"prompt": "Explain RLHF in one sentence."}'Relacionado
- Referencia completa en Read the Docs — configuración y API completas, ajustada a cada versión
- Datasets y experimentos — para comparación offline a escala de dataset
- Comparación por pares — anota preferencias A/B en el flujo principal