AI · LEADERBOARD

不是选最强的模型。 而是选最适合 这份工作的模型。

把智能、速度、成本、Context 与落地条件放在同一张决策桌上。

資料快照: 21 Jul 2026 · 10:01 TST12 個模型已比較

獨立編輯快照 · 並非即時平台流量

先看結論

三個領先者,回答三種不同的決策。

綜合表現最佳

封閉模型

Anthropic

智慧指標
59.9
速度
70tok/s
輸入/輸出
$10 / $50
Context
1M

最適合

高風險推理與複雜 Agentic 工作流

最佳開放模型

開放權重

Z AI

智慧指標
51.1
速度
198tok/s
輸入/輸出
$1.4 / $4.4
Context
1M

最適合

仍需強推理能力的自主部署情境

最佳性價比

開放權重

Xiaomi

智慧指標
37.2
速度
64tok/s
輸入/輸出
$0.14 / $0.29
Context
1.05M

最適合

成本敏感的擷取與大量結構化工作

OpenRouter 使用量

OpenRouter LLM 使用量排行

依 OpenRouter 實際處理的 Prompt、Completion 與 Reasoning token 排序,只顯示前 20 名。

前 20 名OpenRouter 資料 · 每小時快取上游資料 · 2026年7月21日
  1. 1.Hy3 (free)Tencent10.2T tokens24%
  2. 2.MiMo-V2.5Xiaomi9.43T tokens29%
  3. 3.DeepSeek V4 FlashDeepSeek5.37T tokens2%
  4. 4.GLM 5.2Z.ai3.63T tokens16%
  5. 5.MiniMax M3MiniMax3.23T tokens22%
  6. 6.DeepSeek V4 ProDeepSeek2.8T tokens9%
  7. 7.Nemotron 3 Ultra (free)Nvidia2.67T tokens2%
  8. 8.Claude Opus 4.7Anthropic1.93T tokens8%
  9. 9.Claude Opus 4.8Anthropic1.91T tokens13%
  10. 10.Claude Sonnet 5Anthropic1.13T tokens21%
  11. 11.Gemini 3 Flash PreviewGoogle963B tokens3%
  12. 12.Step 3.7 FlashStepFun961B tokens5%
  13. 13.Claude Sonnet 4.6Anthropic877B tokens8%
  14. 14.Kimi K3Moonshot AI741B tokens新上榜
  15. 15.Hy3Tencent638B tokens>999%
  16. 16.GPT-5.5 (batch)OpenAI599B tokens22%
  17. 17.Gemini 2.5 FlashGoogle591B tokens3%
  18. 18.Laguna M.1 (free)Poolside575B tokens3%
  19. 19.MiMo-V2.5-ProXiaomi572B tokens12%
  20. 20.Gemini 2.5 Flash LiteGoogle570B tokens2%

從 Benchmark 回到決策

哪一份工作,該用哪一個模型?

九種常見的正式環境情境,以及團隊在承諾採用一個模型之前,真正需要看清楚的取捨。

目前情境

01 / 09

決策視圖

客戶服務

匹配理由

  1. 01294 tok/s 降低等待
  2. 02支援多語言輸入
  3. 03多模態分流能力強

排名方法

透明到讓你有辦法不同意。

排行榜綜合公開 Benchmark 訊號、價格、實測吞吐量、Context 與部署限制。它是決策工具,不是對模型品質的唯一答案。

資料快照
21 Jul 2026 · 10:01 TST
校驗節奏
重大模型資料變動時重新校驗

價值分數

(智慧指標 − 25)² × min(1,速度 ÷ 30)÷(輸入成本 + 輸出成本 × 3)

輸出成本以 3 倍計入,反映正式環境多半偏輸出的使用型態;智慧指標平方,避免便宜但能力不足的模型主導排名。

智慧
公開 Benchmark 與綜合推理訊號,是預設排序的主軸。
速度
每秒輸出 token;真正體感仍會受供應商與區域影響。
成本
每百萬 token 的公開輸入/輸出價格,不含企業折扣。
部署
Context、權重開放性與自主部署條件,決定是否適合正式環境。

公開參考來源

價格與效能可能隨時變動。採購前,請用自己的 Prompt、基礎設施與風險條件重新驗證最後候選。

FAQ

別讓 Benchmark 自己贏得辯論。

TENTEN AI · MODEL EVALUATION

排行榜只是起點

帶一條工作流程來。我們把候選模型跑過一次。

模型只有通過你的文件、權限、延遲預算與失敗案例之後,才算是一個好決定。