Skip to content

模型競技場

將同一條提示詞並排傳送給 N 個模型,對比它們的回覆並選出最佳,從而構建勝率排行榜。不繫結任何提供商 —— 在同一檢視中對比 OpenAI、Anthropic、Ollama、vLLM 和 Gemini,免費且可自託管。

模型競技場將同一條提示詞並排傳送給多個模型,讓你對比回覆並選出最佳,並構建勝率排行榜。 它不繫結任何提供商:每個模型都通過 Potato 的端點工廠構建,因此你可以在同一檢視中對比 OpenAI、Anthropic、Ollama、vLLM、Gemini 和 OpenRouter。

啟用

yaml
arena:
  enabled: true
  models:
    - {label: "GPT-4o",  endpoint_type: openai,    model: gpt-4o}
    - {label: "Claude",  endpoint_type: anthropic, model: claude-sonnet-4-6}
    - {label: "Llama",   endpoint_type: ollama,    model: llama3.2, base_url: http://localhost:11434}

每個條目對應一份端點配置(endpoint_typemodelbase_urltemperature,以及用於金鑰/參數的可選 ai_config)。啟用後,管理面板會顯示 Arena 連結。

工作方式

  1. 輸入一條提示詞,它會併發傳送給每個模型。某個模型失敗(金鑰錯誤、提供商宕機)絕不會阻塞其他模型;它的卡片會顯示錯誤資訊。
  2. 回覆並排渲染,每個模型附有各自的延遲。
  3. 點選選為最佳記錄一次偏好並更新排行榜(每個模型的勝場、對比次數和勝率)。

API

方法路徑用途
POST/admin/arena/api/run{prompt} → 各模型的回覆
POST/admin/arena/api/preference{prompt, winner, ranking?} → 記錄一次選擇
GET/admin/arena/api/leaderboard每個模型的勝率
bash
curl -X POST localhost:8000/admin/arena/api/run -H "X-API-Key: <key>" \
  -H "Content-Type: application/json" -d '{"prompt": "Explain RLHF in one sentence."}'

相關內容