綜合表現最佳
封閉模型
Anthropic
- 智慧指標
- 60.7
- 速度
- 61tok/s
- 輸入/輸出
- $5 / $25
- Context
- 1M
最適合
頂尖推理與複雜 Agentic 工作流
先看結論
綜合表現最佳
封閉模型
Anthropic
最適合
頂尖推理與複雜 Agentic 工作流
最佳開放模型
開放權重
Kimi
最適合
需要最高智慧指標的自主開放權重部署
最佳性價比
開放權重
Xiaomi
最適合
成本敏感的擷取與大量結構化工作
OpenRouter 使用量
依 OpenRouter 實際處理的 Prompt、Completion 與 Reasoning token 排序,只顯示前 20 名。
從 Benchmark 回到決策
九種常見的正式環境情境,以及團隊在承諾採用一個模型之前,真正需要看清楚的取捨。
目前情境
01 / 09
決策視圖
匹配理由
排名方法
排行榜綜合公開 Benchmark 訊號、價格、實測吞吐量、Context 與部署限制。它是決策工具,不是對模型品質的唯一答案。
價值分數
(智慧指標 − 25)² × min(1,速度 ÷ 30)÷(輸入成本 + 輸出成本 × 3)
輸出成本以 3 倍計入,反映正式環境多半偏輸出的使用型態;智慧指標平方,避免便宜但能力不足的模型主導排名。
公開參考來源
價格與效能可能隨時變動。採購前,請用自己的 Prompt、基礎設施與風險條件重新驗證最後候選。
FAQ
以智慧指標為主的預設排名中,Claude Opus 5 位居第一。但當價格、延遲、部署與任務評測加入後,真正適合的選擇可能完全不同。
Kimi K3 是這份快照中領先的開放權重模型,兼具目前最高的開放模型智慧訊號、1M token Context 與自主部署彈性。
MiMo-V2.5 因 token 價格低、Context 大,在價值公式中居首。它特別適合結構化、大量且成本敏感的工作。
不代表。Context 容量只說明能送入多少內容;檢索設計、指令品質、模型注意力行為與評測方式,才決定這些內容是否真的產生好答案。
這是一份編輯快照,不是即時平台流量。重大模型發布,或價格、效能出現實質變動時,我們會重新校驗資料。
預設順序採用公開智慧指標;速度、價格、Context、開放性與獨立的價值公式會並列呈現,讓團隊可以挑戰預設排序。
Tenten 不透過這個頁面販售模型 token。所有公開來源與假設都會列出,正式採用前仍建議進行任務專屬評測。
TENTEN AI · MODEL EVALUATION
排行榜只是起點
模型探索器
沒有任何一個分數能說完整個故事。先縮小範圍、看懂取捨,再把最後候選放在一起比較。
12個模型
| 比較模型 | 模型 | 適合情境 | ||||||
|---|---|---|---|---|---|---|---|---|
| #1 | 60.7 | 61 tok/s | 15.9 | $5 / $25input / output | 1M | 頂尖推理與複雜 Agentic 工作流 | ||
| #2 | 59.9 | 71 tok/s | 5.8 | $10 / $50input / output | 1M | 需要 fallback 安全性的高可靠度企業工作 | ||
| #3 | 58.9 | 76 tok/s | 9.4 | $5 / $30input / output | 1.1M | 企業級推理與大規模 Context 問題解決 | ||
| #4 | 57.1 | 36 tok/s | 12.7 | $3 / $15input / output | 1.0M | 需要最高智慧指標的自主開放權重部署 | ||
| #5 | 55.0 | 135 tok/s | 18.4 | $2 / $12input / output | 1.1M | 兼顧速度與成本的企業推理 | ||
| #6 | 53.8 | 64 tok/s | 31.2 | $2 / $6input / output | 500K | 需要即時資訊的快速推理任務 | ||
| #7 | 53.4 | 95 tok/s | 23.1 | $2 / $10input / output | 1M | 兼顧 Agent、程式與長文本的工作流 | ||
| #8 | 51.2 | 212 tok/s | 37.8 | $1 / $6input / output | 1.1M | 成本可控的高吞吐量推理 | ||
| #9 | 51.1 | 198 tok/s | 45.3 | $1.4 / $4.4input / output | 1.0M | 仍需強推理能力的自主部署情境 | ||
| #10 | 50.6 | 217 tok/s | 43.8 | $1.25 / $4.25input / output | 1.0M | 大型文件分析與結構化擷取 | ||
| #11 | 50.2 | 288 tok/s | 24.2 | $1.5 / $9input / output | 1M | 即時客服、翻譯與多模態輸入 | ||
| #12 | 37.2 | 82 tok/s | 171.1 | $0.14 / $0.28input / output | 1.1M | 成本敏感的擷取與大量結構化工作 |
最適合
頂尖推理與複雜 Agentic 工作流
最適合
需要 fallback 安全性的高可靠度企業工作
最適合
企業級推理與大規模 Context 問題解決
最適合
需要最高智慧指標的自主開放權重部署
最適合
兼顧速度與成本的企業推理
最適合
需要即時資訊的快速推理任務
最適合
兼顧 Agent、程式與長文本的工作流
最適合
成本可控的高吞吐量推理
最適合
仍需強推理能力的自主部署情境
最適合
大型文件分析與結構化擷取
最適合
即時客服、翻譯與多模態輸入
最適合
成本敏感的擷取與大量結構化工作