मॉडल एरीना
एक प्रॉम्प्ट N मॉडलों को साथ-साथ भेजें, उनकी प्रतिक्रियाओं की तुलना करें, और सर्वश्रेष्ठ चुनकर win-rate लीडरबोर्ड बनाएँ। प्रोवाइडर-अज्ञेय — OpenAI, Anthropic, Ollama, vLLM और Gemini की एक ही दृश्य में तुलना करें, मुफ़्त और self-hosted।
मॉडल एरीना एक प्रॉम्प्ट को कई मॉडलों के पास साथ-साथ भेजता है, प्रतिक्रियाओं की तुलना करके सर्वश्रेष्ठ चुनने देता है, और एक win-rate लीडरबोर्ड बनाता है। यह प्रोवाइडर-अज्ञेय है: हर मॉडल Potato की एंडपॉइंट फ़ैक्टरी से बनता है, इसलिए आप OpenAI, Anthropic, Ollama, vLLM, Gemini और OpenRouter की तुलना एक ही दृश्य में कर सकते हैं।
सक्रिय करना
arena:
enabled: true
models:
- {label: "GPT-4o", endpoint_type: openai, model: gpt-4o}
- {label: "Claude", endpoint_type: anthropic, model: claude-sonnet-4-6}
- {label: "Llama", endpoint_type: ollama, model: llama3.2, base_url: http://localhost:11434}हर प्रविष्टि एक एंडपॉइंट कॉन्फ़िग से जुड़ती है (endpoint_type, model, base_url, temperature, कुंजियों/पैरामीटरों के लिए वैकल्पिक ai_config)। सक्रिय होने पर, एडमिन डैशबोर्ड एक Arena लिंक दिखाता है।
यह कैसे काम करता है
- एक प्रॉम्प्ट दर्ज करें और वह हर मॉडल के पास समानांतर रूप से जाता है। किसी एक मॉडल के विफल होने (ग़लत कुंजी, प्रोवाइडर डाउन) से बाक़ी कभी अवरुद्ध नहीं होते; उसके कार्ड पर त्रुटि दिखती है।
- प्रतिक्रियाएँ साथ-साथ प्रदर्शित होती हैं, हर एक के साथ प्रति-मॉडल लेटेंसी।
- Pick as best पर क्लिक करके वरीयता दर्ज करें और लीडरबोर्ड अद्यतन करें (प्रति मॉडल जीतें, तुलनाएँ और win rate)।
API
| मेथड | पथ | उद्देश्य |
|---|---|---|
| POST | /admin/arena/api/run | {prompt} → प्रति-मॉडल प्रतिक्रियाएँ |
| POST | /admin/arena/api/preference | {prompt, winner, ranking?} → चयन दर्ज करें |
| GET | /admin/arena/api/leaderboard | प्रति मॉडल win-rate |
curl -X POST localhost:8000/admin/arena/api/run -H "X-API-Key: <key>" \
-H "Content-Type: application/json" -d '{"prompt": "Explain RLHF in one sentence."}'संबंधित
- Read the Docs पर पूर्ण संदर्भ — पूर्ण कॉन्फ़िग और API, संस्करण-अनुरूप
- डेटासेट और प्रयोग — ऑफ़लाइन, डेटासेट-पैमाने की तुलना के लिए
- जोड़ीवार तुलना — मुख्य प्रवाह में A/B वरीयताएँ एनोटेट करें