Arène de modèles
Envoyez un même prompt à N modèles côte à côte, comparez leurs réponses et choisissez la meilleure pour construire un classement par taux de victoire. Indépendant du fournisseur — comparez OpenAI, Anthropic, Ollama, vLLM et Gemini dans une seule vue, gratuit et auto-hébergé.
L'arène de modèles envoie un même prompt à plusieurs modèles côte à côte, vous laisse comparer les réponses et choisir la meilleure, et construit un classement par taux de victoire. Elle est indépendante du fournisseur : chaque modèle est construit via la fabrique de points de terminaison de Potato, ce qui permet de comparer OpenAI, Anthropic, Ollama, vLLM, Gemini et OpenRouter dans la même vue.
Activation
arena:
enabled: true
models:
- {label: "GPT-4o", endpoint_type: openai, model: gpt-4o}
- {label: "Claude", endpoint_type: anthropic, model: claude-sonnet-4-6}
- {label: "Llama", endpoint_type: ollama, model: llama3.2, base_url: http://localhost:11434}Chaque entrée correspond à une configuration de point de terminaison (endpoint_type, model, base_url, temperature, et ai_config en option pour les clés et paramètres). Une fois la fonctionnalité activée, le tableau de bord d'administration affiche un lien Arena.
Fonctionnement
- Saisissez un prompt : il est envoyé à tous les modèles en parallèle. La défaillance d'un modèle (clé invalide, fournisseur indisponible) ne bloque jamais les autres ; sa carte affiche l'erreur.
- Les réponses s'affichent côte à côte, chacune avec la latence du modèle.
- Cliquez sur Pick as best pour enregistrer une préférence et mettre à jour le classement (victoires, comparaisons et taux de victoire par modèle).
API
| Méthode | Chemin | Rôle |
|---|---|---|
| POST | /admin/arena/api/run | {prompt} → réponses par modèle |
| POST | /admin/arena/api/preference | {prompt, winner, ranking?} → enregistrer un choix |
| GET | /admin/arena/api/leaderboard | taux de victoire par modèle |
curl -X POST localhost:8000/admin/arena/api/run -H "X-API-Key: <key>" \
-H "Content-Type: application/json" -d '{"prompt": "Explain RLHF in one sentence."}'Pages liées
- Référence complète sur Read the Docs — configuration et API complètes, alignée sur la version
- Jeux de données et expériences — pour la comparaison hors ligne à l'échelle d'un jeu de données
- Comparaison par paires — annoter des préférences A/B dans le flux principal