Skip to content

मॉडल एरीना

एक प्रॉम्प्ट N मॉडलों को साथ-साथ भेजें, उनकी प्रतिक्रियाओं की तुलना करें, और सर्वश्रेष्ठ चुनकर win-rate लीडरबोर्ड बनाएँ। प्रोवाइडर-अज्ञेय — OpenAI, Anthropic, Ollama, vLLM और Gemini की एक ही दृश्य में तुलना करें, मुफ़्त और self-hosted।

मॉडल एरीना एक प्रॉम्प्ट को कई मॉडलों के पास साथ-साथ भेजता है, प्रतिक्रियाओं की तुलना करके सर्वश्रेष्ठ चुनने देता है, और एक win-rate लीडरबोर्ड बनाता है। यह प्रोवाइडर-अज्ञेय है: हर मॉडल Potato की एंडपॉइंट फ़ैक्टरी से बनता है, इसलिए आप OpenAI, Anthropic, Ollama, vLLM, Gemini और OpenRouter की तुलना एक ही दृश्य में कर सकते हैं।

सक्रिय करना

yaml
arena:
  enabled: true
  models:
    - {label: "GPT-4o",  endpoint_type: openai,    model: gpt-4o}
    - {label: "Claude",  endpoint_type: anthropic, model: claude-sonnet-4-6}
    - {label: "Llama",   endpoint_type: ollama,    model: llama3.2, base_url: http://localhost:11434}

हर प्रविष्टि एक एंडपॉइंट कॉन्फ़िग से जुड़ती है (endpoint_type, model, base_url, temperature, कुंजियों/पैरामीटरों के लिए वैकल्पिक ai_config)। सक्रिय होने पर, एडमिन डैशबोर्ड एक Arena लिंक दिखाता है।

यह कैसे काम करता है

  1. एक प्रॉम्प्ट दर्ज करें और वह हर मॉडल के पास समानांतर रूप से जाता है। किसी एक मॉडल के विफल होने (ग़लत कुंजी, प्रोवाइडर डाउन) से बाक़ी कभी अवरुद्ध नहीं होते; उसके कार्ड पर त्रुटि दिखती है।
  2. प्रतिक्रियाएँ साथ-साथ प्रदर्शित होती हैं, हर एक के साथ प्रति-मॉडल लेटेंसी।
  3. Pick as best पर क्लिक करके वरीयता दर्ज करें और लीडरबोर्ड अद्यतन करें (प्रति मॉडल जीतें, तुलनाएँ और win rate)।

API

मेथडपथउद्देश्य
POST/admin/arena/api/run{prompt} → प्रति-मॉडल प्रतिक्रियाएँ
POST/admin/arena/api/preference{prompt, winner, ranking?} → चयन दर्ज करें
GET/admin/arena/api/leaderboardप्रति मॉडल win-rate
bash
curl -X POST localhost:8000/admin/arena/api/run -H "X-API-Key: <key>" \
  -H "Content-Type: application/json" -d '{"prompt": "Explain RLHF in one sentence."}'

संबंधित