模型競技場
將同一條提示詞並排傳送給 N 個模型,對比它們的回覆並選出最佳,從而構建勝率排行榜。不繫結任何提供商 —— 在同一檢視中對比 OpenAI、Anthropic、Ollama、vLLM 和 Gemini,免費且可自託管。
模型競技場將同一條提示詞並排傳送給多個模型,讓你對比回覆並選出最佳,並構建勝率排行榜。 它不繫結任何提供商:每個模型都通過 Potato 的端點工廠構建,因此你可以在同一檢視中對比 OpenAI、Anthropic、Ollama、vLLM、Gemini 和 OpenRouter。
啟用
yaml
arena:
enabled: true
models:
- {label: "GPT-4o", endpoint_type: openai, model: gpt-4o}
- {label: "Claude", endpoint_type: anthropic, model: claude-sonnet-4-6}
- {label: "Llama", endpoint_type: ollama, model: llama3.2, base_url: http://localhost:11434}每個條目對應一份端點配置(endpoint_type、model、base_url、temperature,以及用於金鑰/參數的可選 ai_config)。啟用後,管理面板會顯示 Arena 連結。
工作方式
- 輸入一條提示詞,它會併發傳送給每個模型。某個模型失敗(金鑰錯誤、提供商宕機)絕不會阻塞其他模型;它的卡片會顯示錯誤資訊。
- 回覆並排渲染,每個模型附有各自的延遲。
- 點選選為最佳記錄一次偏好並更新排行榜(每個模型的勝場、對比次數和勝率)。
API
| 方法 | 路徑 | 用途 |
|---|---|---|
| POST | /admin/arena/api/run | {prompt} → 各模型的回覆 |
| POST | /admin/arena/api/preference | {prompt, winner, ranking?} → 記錄一次選擇 |
| GET | /admin/arena/api/leaderboard | 每個模型的勝率 |
bash
curl -X POST localhost:8000/admin/arena/api/run -H "X-API-Key: <key>" \
-H "Content-Type: application/json" -d '{"prompt": "Explain RLHF in one sentence."}'相關內容
- Read the Docs 上的完整參考 —— 完整的配置和 API,與版本匹配
- 資料集與實驗 —— 用於離線的、資料集規模的對比
- 成對比較 —— 在主流程中標註 A/B 偏好