Modell-Arena
Senden Sie einen Prompt gleichzeitig an N Modelle, vergleichen Sie deren Antworten nebeneinander und wählen Sie die beste aus, um eine Gewinnraten-Rangliste aufzubauen. Anbieterunabhängig — vergleichen Sie OpenAI, Anthropic, Ollama, vLLM und Gemini in einer Ansicht, kostenlos und selbst gehostet.
Die Modell-Arena sendet einen Prompt gleichzeitig an mehrere Modelle, lässt Sie die Antworten vergleichen und die beste auswählen, und baut daraus eine Gewinnraten-Rangliste auf. Sie ist anbieterunabhängig: Jedes Modell wird über die Endpunkt-Factory von Potato erzeugt, sodass Sie OpenAI, Anthropic, Ollama, vLLM, Gemini und OpenRouter in derselben Ansicht vergleichen können.
Aktivieren
arena:
enabled: true
models:
- {label: "GPT-4o", endpoint_type: openai, model: gpt-4o}
- {label: "Claude", endpoint_type: anthropic, model: claude-sonnet-4-6}
- {label: "Llama", endpoint_type: ollama, model: llama3.2, base_url: http://localhost:11434}Jeder Eintrag entspricht einer Endpunkt-Konfiguration (endpoint_type, model, base_url, temperature, optional ai_config für Schlüssel/Parameter). Bei aktivierter Arena zeigt das Admin-Dashboard einen Arena-Link an.
Funktionsweise
- Geben Sie einen Prompt ein; er geht gleichzeitig an alle Modelle. Fällt ein Modell aus (ungültiger Schlüssel, Anbieter nicht erreichbar), blockiert das die anderen nie; die betroffene Karte zeigt den Fehler an.
- Die Antworten erscheinen nebeneinander, jeweils mit der Latenz pro Modell.
- Ein Klick auf Pick as best zeichnet eine Präferenz auf und aktualisiert die Rangliste (Siege, Vergleiche und Gewinnrate pro Modell).
API
| Methode | Pfad | Zweck |
|---|---|---|
| POST | /admin/arena/api/run | {prompt} → Antworten pro Modell |
| POST | /admin/arena/api/preference | {prompt, winner, ranking?} → eine Auswahl aufzeichnen |
| GET | /admin/arena/api/leaderboard | Gewinnrate pro Modell |
curl -X POST localhost:8000/admin/arena/api/run -H "X-API-Key: <key>" \
-H "Content-Type: application/json" -d '{"prompt": "Explain RLHF in one sentence."}'Verwandte Themen
- Vollständige Referenz auf Read the Docs — vollständige Konfiguration und API, versionsgenau
- Datensätze & Experimente — für den Offline-Vergleich im Datensatzmaßstab
- Paarweiser Vergleich — A/B-Präferenzen im regulären Ablauf annotieren