Skip to content

模型竞技场

将同一条提示词并排发送给 N 个模型,对比它们的回复并选出最佳,从而构建胜率排行榜。不绑定任何提供商 —— 在同一视图中对比 OpenAI、Anthropic、Ollama、vLLM 和 Gemini,免费且可自托管。

模型竞技场将同一条提示词并排发送给多个模型,让你对比回复并选出最佳,并构建胜率排行榜。 它不绑定任何提供商:每个模型都通过 Potato 的端点工厂构建,因此你可以在同一视图中对比 OpenAI、Anthropic、Ollama、vLLM、Gemini 和 OpenRouter。

启用

yaml
arena:
  enabled: true
  models:
    - {label: "GPT-4o",  endpoint_type: openai,    model: gpt-4o}
    - {label: "Claude",  endpoint_type: anthropic, model: claude-sonnet-4-6}
    - {label: "Llama",   endpoint_type: ollama,    model: llama3.2, base_url: http://localhost:11434}

每个条目对应一份端点配置(endpoint_typemodelbase_urltemperature,以及用于密钥/参数的可选 ai_config)。启用后,管理面板会显示 Arena 链接。

工作方式

  1. 输入一条提示词,它会并发发送给每个模型。某个模型失败(密钥错误、提供商宕机)绝不会阻塞其他模型;它的卡片会显示错误信息。
  2. 回复并排渲染,每个模型附有各自的延迟。
  3. 点击选为最佳记录一次偏好并更新排行榜(每个模型的胜场、对比次数和胜率)。

API

方法路径用途
POST/admin/arena/api/run{prompt} → 各模型的回复
POST/admin/arena/api/preference{prompt, winner, ranking?} → 记录一次选择
GET/admin/arena/api/leaderboard每个模型的胜率
bash
curl -X POST localhost:8000/admin/arena/api/run -H "X-API-Key: <key>" \
  -H "Content-Type: application/json" -d '{"prompt": "Explain RLHF in one sentence."}'

相关内容