綜合表現最佳
封閉模型
Anthropic
- 智慧指標
- 59.9
- 速度
- 70tok/s
- 輸入/輸出
- $10 / $50
- Context
- 1M
最適合
高風險推理與複雜 Agentic 工作流
先看結論
綜合表現最佳
封閉模型
Anthropic
最適合
高風險推理與複雜 Agentic 工作流
最佳開放模型
開放權重
Z AI
最適合
仍需強推理能力的自主部署情境
最佳性價比
開放權重
Xiaomi
最適合
成本敏感的擷取與大量結構化工作
OpenRouter 使用量
依 OpenRouter 實際處理的 Prompt、Completion 與 Reasoning token 排序,只顯示前 20 名。
從 Benchmark 回到決策
九種常見的正式環境情境,以及團隊在承諾採用一個模型之前,真正需要看清楚的取捨。
目前情境
01 / 09
決策視圖
匹配理由
排名方法
排行榜綜合公開 Benchmark 訊號、價格、實測吞吐量、Context 與部署限制。它是決策工具,不是對模型品質的唯一答案。
價值分數
(智慧指標 − 25)² × min(1,速度 ÷ 30)÷(輸入成本 + 輸出成本 × 3)
輸出成本以 3 倍計入,反映正式環境多半偏輸出的使用型態;智慧指標平方,避免便宜但能力不足的模型主導排名。
公開參考來源
價格與效能可能隨時變動。採購前,請用自己的 Prompt、基礎設施與風險條件重新驗證最後候選。
FAQ
以智慧指標為主的預設排名中,Claude Fable 5 位居第一。但當價格、延遲、部署與任務評測加入後,真正適合的選擇可能完全不同。
GLM-5.2 是這份快照中領先的開放權重模型,同時兼顧強推理訊號、高吞吐量與自主部署彈性。
MiMo-V2.5 因 token 價格低、Context 大,在價值公式中居首。它特別適合結構化、大量且成本敏感的工作。
不代表。Context 容量只說明能送入多少內容;檢索設計、指令品質、模型注意力行為與評測方式,才決定這些內容是否真的產生好答案。
這是一份編輯快照,不是即時平台流量。重大模型發布,或價格、效能出現實質變動時,我們會重新校驗資料。
預設順序採用公開智慧指標;速度、價格、Context、開放性與獨立的價值公式會並列呈現,讓團隊可以挑戰預設排序。
Tenten 不透過這個頁面販售模型 token。所有公開來源與假設都會列出,正式採用前仍建議進行任務專屬評測。
TENTEN AI · MODEL EVALUATION
排行榜只是起點
模型探索器
沒有任何一個分數能說完整個故事。先縮小範圍、看懂取捨,再把最後候選放在一起比較。
12個模型
| 比較模型 | 模型 | 適合情境 | ||||||
|---|---|---|---|---|---|---|---|---|
| #1 | 59.9 | 70 tok/s | 5.8 | $10 / $50input / output | 1M | 高風險推理與複雜 Agentic 工作流 | ||
| #2 | 58.9 | 68 tok/s | 9.4 | $5 / $30input / output | 1M | 企業級推理與大規模 Context 問題解決 | ||
| #3 | 57.1 | 39 tok/s | 12.7 | $3 / $15input / output | 1M | 需要開放部署選項的超長文本任務 | ||
| #4 | 55.7 | 62 tok/s | 8.8 | $5 / $25input / output | 1M | 深度分析與複雜文件處理 | ||
| #5 | 55.0 | 154 tok/s | 18.4 | $2.5 / $15input / output | 1M | 兼顧速度與成本的企業推理 | ||
| #6 | 53.8 | 75 tok/s | 31.2 | $2 / $6input / output | 500K | 需要即時資訊的快速推理任務 | ||
| #7 | 53.4 | 91 tok/s | 23.1 | $2 / $10input / output | 1M | 兼顧 Agent、程式與長文本的工作流 | ||
| #8 | 51.2 | 212 tok/s | 37.8 | $1 / $6input / output | 1M | 成本可控的高吞吐量推理 | ||
| #9 | 51.1 | 198 tok/s | 45.3 | $1.4 / $4.4input / output | 1M | 仍需強推理能力的自主部署情境 | ||
| #10 | 50.6 | 122 tok/s | 43.8 | $1.25 / $4.25input / output | 1.0M | 大型文件分析與結構化擷取 | ||
| #11 | 50.2 | 294 tok/s | 24.2 | $1.5 / $9input / output | 1M | 即時客服、翻譯與多模態輸入 | ||
| #12 | 37.2 | 64 tok/s | 171.1 | $0.14 / $0.29input / output | 1.0M | 成本敏感的擷取與大量結構化工作 |
最適合
高風險推理與複雜 Agentic 工作流
最適合
企業級推理與大規模 Context 問題解決
最適合
需要開放部署選項的超長文本任務
最適合
深度分析與複雜文件處理
最適合
兼顧速度與成本的企業推理
最適合
需要即時資訊的快速推理任務
最適合
兼顧 Agent、程式與長文本的工作流
最適合
成本可控的高吞吐量推理
最適合
仍需強推理能力的自主部署情境
最適合
大型文件分析與結構化擷取
最適合
即時客服、翻譯與多模態輸入
最適合
成本敏感的擷取與大量結構化工作