Arena dei modelli (Model Arena)
Invia un prompt a N modelli fianco a fianco, confronta le risposte e scegli la migliore per costruire una classifica per tasso di vittorie. Indipendente dal provider: confronta OpenAI, Anthropic, Ollama, vLLM e Gemini in un'unica vista, gratis e self-hosted.
La Model Arena invia un prompt a più modelli fianco a fianco, ti permette di confrontare le risposte e scegliere la migliore, e costruisce una classifica per tasso di vittorie. È indipendente dal provider: ogni modello è costruito tramite la endpoint factory di Potato, quindi puoi confrontare OpenAI, Anthropic, Ollama, vLLM, Gemini e OpenRouter nella stessa vista.
Attivazione
arena:
enabled: true
models:
- {label: "GPT-4o", endpoint_type: openai, model: gpt-4o}
- {label: "Claude", endpoint_type: anthropic, model: claude-sonnet-4-6}
- {label: "Llama", endpoint_type: ollama, model: llama3.2, base_url: http://localhost:11434}Ogni voce corrisponde a una configurazione di endpoint (endpoint_type, model, base_url, temperature, ai_config opzionale per chiavi/parametri). Quando è attiva, il pannello di amministrazione mostra un collegamento Arena.
Come funziona
- Inserisci un prompt e questo viene inviato a tutti i modelli in parallelo. Il fallimento di un modello (chiave errata, provider fuori servizio) non blocca mai gli altri; la sua scheda mostra l'errore.
- Le risposte compaiono fianco a fianco, ciascuna con la latenza del rispettivo modello.
- Fai clic su Pick as best per registrare una preferenza e aggiornare la classifica (vittorie, confronti e tasso di vittorie per modello).
API
| Metodo | Percorso | Scopo |
|---|---|---|
| POST | /admin/arena/api/run | {prompt} → risposte per modello |
| POST | /admin/arena/api/preference | {prompt, winner, ranking?} → registra una scelta |
| GET | /admin/arena/api/leaderboard | tasso di vittorie per modello |
curl -X POST localhost:8000/admin/arena/api/run -H "X-API-Key: <key>" \
-H "Content-Type: application/json" -d '{"prompt": "Explain RLHF in one sentence."}'Correlati
- Riferimento completo su Read the Docs — configurazione e API complete, allineato alla versione
- Dataset ed esperimenti — per confronti offline su scala di dataset
- Confronto a coppie — annota preferenze A/B nel flusso principale