綜合表現最佳
封閉模型
Anthropic
- 智慧指標
- 63.1
- 速度
- 58.8tok/s
- 輸入/輸出
- $5 / $25
- Context
- 1M
最適合
頂尖推理與複雜 Agentic 工作流
先看結論
綜合表現最佳
封閉模型
Anthropic
最適合
頂尖推理與複雜 Agentic 工作流
最佳開放模型
開放權重
Kimi
最適合
需要最高智慧指標的自主開放權重部署
最佳價格效能比
開放權重
DeepSeek
最適合
成本敏感的開放模型推論與程式工作負載
OpenRouter 使用量
依 OpenRouter 實際處理的 Prompt、Completion 與 Reasoning token 排序,只顯示前 20 名。
從 Benchmark 回到決策
九種常見的正式環境情境,以及團隊在承諾採用一個模型之前,需要看清楚的取捨。
目前情境
01 / 09
決策視圖
匹配理由
排名方法
排行榜綜合公開 Benchmark 訊號、價格、實測吞吐量、Context 與部署限制。它是決策工具,不是對模型品質的唯一答案。
價值分數
(智慧指標 − 25)² × min(1,速度 ÷ 30)÷(輸入成本 + 輸出成本 × 3)
輸出成本以 3 倍計入,反映正式環境多半偏輸出的使用型態;智慧指標平方,避免便宜但能力不足的模型主導排名。
公開參考來源
價格與效能可能隨時變動。採購前,請用自己的 Prompt、基礎設施與風險條件重新驗證最後候選。
FAQ
第一列與「整體最佳」卡片會顯示目前以智慧指標為主的領先模型。但當價格、延遲、部署與任務評測加入後,適合的選擇可能完全不同。
「最佳開放模型」卡片只會從已驗證可下載權重的模型中,依照與主表相同的智慧指標排序重新計算。
「最佳價值」卡片會在智慧指標、速度或基礎 token 價格獲得新驗證資料後,依照頁面公開公式重新計算。
不代表。Context 容量只說明能送入多少內容;檢索設計、指令品質、模型注意力行為與評測方式,才決定這些內容是否真的產生好答案。
排程會每週及重大模型發布後重新校驗。若來源失敗或互相矛盾,頁面會保留上一份已驗證快照,不會發布不完整資料。
預設順序採用公開智慧指標;速度、價格、Context、開放性與獨立的價值公式會並列呈現,讓團隊可以挑戰預設排序。
Tenten 不透過這個頁面販售模型 token。所有公開來源與假設都會列出,正式採用前仍建議進行任務專屬評測。
TENTEN AI · MODEL EVALUATION
排行榜只是起點
模型探索器
沒有任何一個分數能說完整個故事。先縮小範圍、看懂取捨,再把最後候選放在一起比較。
16個模型
| 比較模型 | 模型 | 適合情境 | ||||||
|---|---|---|---|---|---|---|---|---|
| #1 | 63.1 | 58.8 tok/s | 18.1 | $5 / $25input / output | 1M | 頂尖推理與複雜 Agentic 工作流 | ||
| #2 | 62.1 | 71 tok/s | 8.6 | $10 / $50input / output | 1M | 需要 fallback 安全性的高可靠度企業工作 | ||
| #3 | 60.9 | 73.6 tok/s | 40.3 | $2 / $10input / output | 1.1M | 企業級推理與大規模 Context 問題解決 | ||
| #4 | 60.9 | 61.9 tok/s | 64.5 | $2 / $6input / output | 500K | 高智慧推理與具競爭力 token 價格的專有模型 | ||
| #5 | 59.7 | 35 tok/s | 25.1 | $3 / $15input / output | 1.0M | 需要最高智慧指標的自主開放權重部署 | ||
| #6 | 58.1 | 23 tok/s | 42.0 | $2 / $6input / output | 1M | 高智慧多語言任務與長篇翻譯 | ||
| #7 | 56.8 | N/A | N/A | $1.25 / $4.25input / output | 1.0M | 超長 Context 分析與結構化資料擷取 | ||
| #8 | 56.6 | 121.5 tok/s | 26.2 | $2 / $12input / output | 1.1M | 兼顧速度與成本的企業推理 | ||
| #9 | 55.8 | 58 tok/s | 47.4 | $2 / $6input / output | 500K | 需要即時資訊的快速推理任務 | ||
| #10 | 55.3 | 69 tok/s | 28.7 | $2 / $10input / output | 1M | 兼顧 Agent、程式與長文本的工作流 | ||
| #11 | 53.2 | 71.7 tok/s | 70.9 | $1.12 / $3.37input / output | 1.0M | 低成本的開放權重推理與程式工作負載 | ||
| #12 | 52.6 | 152.8 tok/s | 61.4 | $1.19 / $3.74input / output | 1.0M | 仍需強推理能力的自主部署情境 | ||
| #13 | 52.3 | 140.7 tok/s | 196.4 | $0.20 / $1.2input / output | 1.1M | 低延遲、成本可控的大量客戶服務 | ||
| #14 | 51.8 | 115 tok/s | 732.9 | $0.14 / $0.28input / output | 1.3M | 成本敏感的開放模型推論與程式工作負載 | ||
| #15 | 51.6 | 221 tok/s | 59.0 | $0.75 / $3.75input / output | 1.0M | 即時客服、翻譯與多模態輸入 | ||
| #16 | 38.0 | 82 tok/s | 172.4 | $0.14 / $0.28input / output | 1.1M | 成本敏感的擷取與大量結構化工作 |
最適合
頂尖推理與複雜 Agentic 工作流
最適合
需要 fallback 安全性的高可靠度企業工作
最適合
企業級推理與大規模 Context 問題解決
最適合
高智慧推理與具競爭力 token 價格的專有模型
最適合
需要最高智慧指標的自主開放權重部署
最適合
高智慧多語言任務與長篇翻譯
最適合
超長 Context 分析與結構化資料擷取
最適合
兼顧速度與成本的企業推理
最適合
需要即時資訊的快速推理任務
最適合
兼顧 Agent、程式與長文本的工作流
最適合
低成本的開放權重推理與程式工作負載
最適合
仍需強推理能力的自主部署情境
最適合
低延遲、成本可控的大量客戶服務
最適合
成本敏感的開放模型推論與程式工作負載
最適合
即時客服、翻譯與多模態輸入
最適合
成本敏感的擷取與大量結構化工作