模型竞技场
将同一条提示词并排发送给 N 个模型,对比它们的回复并选出最佳,从而构建胜率排行榜。不绑定任何提供商 —— 在同一视图中对比 OpenAI、Anthropic、Ollama、vLLM 和 Gemini,免费且可自托管。
模型竞技场将同一条提示词并排发送给多个模型,让你对比回复并选出最佳,并构建胜率排行榜。 它不绑定任何提供商:每个模型都通过 Potato 的端点工厂构建,因此你可以在同一视图中对比 OpenAI、Anthropic、Ollama、vLLM、Gemini 和 OpenRouter。
启用
yaml
arena:
enabled: true
models:
- {label: "GPT-4o", endpoint_type: openai, model: gpt-4o}
- {label: "Claude", endpoint_type: anthropic, model: claude-sonnet-4-6}
- {label: "Llama", endpoint_type: ollama, model: llama3.2, base_url: http://localhost:11434}每个条目对应一份端点配置(endpoint_type、model、base_url、temperature,以及用于密钥/参数的可选 ai_config)。启用后,管理面板会显示 Arena 链接。
工作方式
- 输入一条提示词,它会并发发送给每个模型。某个模型失败(密钥错误、提供商宕机)绝不会阻塞其他模型;它的卡片会显示错误信息。
- 回复并排渲染,每个模型附有各自的延迟。
- 点击选为最佳记录一次偏好并更新排行榜(每个模型的胜场、对比次数和胜率)。
API
| 方法 | 路径 | 用途 |
|---|---|---|
| POST | /admin/arena/api/run | {prompt} → 各模型的回复 |
| POST | /admin/arena/api/preference | {prompt, winner, ranking?} → 记录一次选择 |
| GET | /admin/arena/api/leaderboard | 每个模型的胜率 |
bash
curl -X POST localhost:8000/admin/arena/api/run -H "X-API-Key: <key>" \
-H "Content-Type: application/json" -d '{"prompt": "Explain RLHF in one sentence."}'相关内容
- Read the Docs 上的完整参考 —— 完整的配置和 API,与版本匹配
- 数据集与实验 —— 用于离线的、数据集规模的对比
- 成对比较 —— 在主流程中标注 A/B 偏好