大模型 API 价格计算器
对比 Claude、GPT、Gemini、DeepSeek、Kimi、Grok 等大模型的最新 API 价格,按 token 用量估算月账单——包含多数对比表忽略的提示词缓存价与批量折扣。选择你当前在用的模型,还能直接看到迁移到每个备选每月省(或多花)多少钱。 价格核实日期 2026-09-04. 完全在浏览器本地运行——不上传、无需注册。
按缓存价计费的输入 token 占比
选中后表格会多一列,显示按当前用量换到每个模型每月省/多花多少。
| 模型 | 输入 $/M | 输出 $/M | 缓存 $/M | 上下文 | 估算月成本 |
|---|---|---|---|---|---|
GPT-5.6 luna OpenAI | $0.2 | $1.2 | $0.02 | 1.05M | $22.00 |
Gemini 3.1 Flash-Lite | $0.25 | $1.5 | $0.025 | 1M | $27.50 |
DeepSeek V4 Flash DeepSeek · 开源权重 | $0.435 | $1.3 | $0.0145 | 1M | $34.75 |
Gemini 3.6 Flash | $0.75 | $3.75 | $0.075 | 1M | $75.00 |
GLM-5 Zhipu (z.ai) · 开源权重 | $1 | $3.2 | $0.2 | 200K | $82.00 |
Grok 4.20 xAI | $1.25 | $2.5 | $0.2 | 1M | $87.50 |
Kimi K2.7 Code Moonshot · 开源权重 | $0.95 | $4 | $0.19 | 262K | $87.50 |
Claude Haiku 4.5 Anthropic | $1 | $5 | $0.1 | 200K | $100 |
DeepSeek V4 Pro DeepSeek · 开源权重 | $1.3 | $3.91 | $0.043 | 1M | $104 |
GLM-5.2 Zhipu (z.ai) · 开源权重 | $1.4 | $4.4 | $0.26 | 200K | $114 |
Grok 4.6 xAI | $2 | $6 | $0.5 | 500K | $160 |
Grok 4.5 xAI | $2 | $6 | $0.3 | 500K | $160 |
Claude Sonnet 5 Anthropic | $2 | $10 | $0.2 | 1M | $200 |
GPT-5.6 terra OpenAI | $2 | $12 | $0.2 | 1.05M | $220 |
Gemini 3.1 Pro Preview | $2 | $12 | $0.2 | 1M | $220 |
Kimi K3 Moonshot · 开源权重 | $3 | $15 | $0.3 | 1.048576M | $300 |
GPT-5.6 sol OpenAI | $4 | $20 | $0.4 | 1.05M | $400 |
Claude Opus 5 Anthropic | $5 | $25 | $0.5 | 1M | $500 |
Claude Fable 5.1 Anthropic | $10 | $50 | $0.25 | 1M | $1000 |
Claude Fable 5 Anthropic | $10 | $50 | $1 | 1M | $1000 |
价格单位为美元/百万 token,标准(非批量)档,核实日期 2026-09-04. Claude Fable 5.1: Released Sep 1, 2026. Anthropic's Mythos-class flagship tier above Opus 5 — same $10/$50 base rate as Fable 5, but cache reads drop to 2.5% of the input price ($0.25/MTok vs the 10% every other Claude model charges). Shares its underlying model with Claude Mythos 5.1, offered only to approved organizations. Claude Fable 5: Superseded by Claude Fable 5.1 (Sep 1, 2026), which keeps the same base rate but cuts cache reads to $0.25/MTok. Fable 5 remains available as a pinned snapshot with cache reads at the standard 10% ($1.00/MTok). Shares its underlying model with Claude Mythos 5. Claude Sonnet 5: The $2 / $10 launch price is now permanent; the planned Sep 2026 increase to $3 / $15 was cancelled. GPT-5.6 sol: Promotional price, available at least through Nov 21, 2026 (previously $5 / $30). Requests beyond the long-context threshold bill at 2× input / 1.5× output. GPT-5.6 terra: Requests beyond the long-context threshold bill at 2× input / 1.5× output. GPT-5.6 luna: Requests beyond the long-context threshold bill at 2× input / 1.5× output. Gemini 3.1 Pro Preview: Prompts over 200K tokens bill at $4 / $18. Gemini 3.6 Flash: Intro price through Dec 31, 2026; $1.50 / $7.50 from Jan 1, 2027. Grok 4.6: Requests over 200K tokens bill at 2×. Grok 4.5: Requests over 200K tokens bill at 2×. Kimi K3: Always-on reasoning; output includes thinking tokens. DeepSeek V4 Pro: Peak-hour price (Beijing weekdays 09:00–12:00, 14:00–18:00) effective Aug 17, 2026; all other hours bill at 50% of peak. DeepSeek V4 Flash: Peak-hour price (Beijing weekdays 09:00–12:00, 14:00–18:00) effective Aug 17, 2026; all other hours bill at 50% of peak.
批量折扣仅对提供异步批量档的厂商生效。缓存价按读取价建模,不含缓存写入加价(Anthropic)。超过厂商阈值的长上下文加价在对应模型旁注明。
按模型查看 API 价格详情
在用的模型要退役了?查 大模型退役时间线。
使用指南 / 为什么使用此工具 / 常见问题
使用指南
输入你预计的月度 token 用量——输入 token 和输出 token(以百万计)。可选设置提示词缓存命中率(按更便宜的缓存价计费的输入 token 占比),以及是否启用异步 Batch API 折扣。表格会立即按估算月成本对所有模型排序,最便宜的高亮显示。可在闭源模型和开源权重模型之间筛选,并一键复制整个对比结果。每个价格都标注了对照官方定价页核实的日期。
为什么使用此工具
大模型 API 价格变化极快——每月都有新模型发布,厂商一年调价数次,搜索结果里的对比表大多已经过时。本计算器对照官方定价页维护,并把简单表格忽略的部分算进去:提示词缓存读取价(常常比普通输入便宜 10 倍)、异步批量折扣、以及输出 token 通常是输入价 3-6 倍这一事实。适合在选型前对比各家价格、用真实流量估算生产预算、或评估换模型/加缓存能省多少钱。如果你也在考虑自托管开源模型,可配合本站「大模型显存计算器」对比 API 成本与自建 GPU 成本。
常见问题
- 月成本是怎么计算的?
- 成本 = 未命中缓存的输入 token × 输入价 + 命中缓存的输入 token × 缓存价 + 输出 token × 输出价(均按每百万 token 计)。启用 Batch API 后,对提供异步批量档的厂商再应用相应折扣(通常 5 折)。
- 价格数据有多新?
- 每个价格都对照厂商官方定价页核实,页面上标注核实日期。厂商调价或发布新模型时我们会更新表格——保鲜正是这个工具存在的意义,搜索结果里的价格对比大多已过期数月。
- 什么是提示词缓存,为什么重要?
- 厂商允许缓存重复的提示词前缀(系统提示、长文档、few-shot 示例),后续请求复用时按远低于普通输入的价格计费——通常只有正常价的 10% 左右。对每轮都重发大量上下文的聊天机器人和 Agent 来说,高缓存命中率能把输入成本降一个数量级,所以本计算器把它显式建模。
- Batch API 折扣是什么?
- 多数主流厂商提供异步批量档:一次提交大量请求,在时间窗口内(通常 24 小时)返回结果,输入输出 token 都按约半价计费。适合评测跑分、向量回填、批量内容处理等离线任务。
- 为什么输出 token 比输入贵?
- 生成每个 token 都需要一次完整前向计算,而输入 token 在预填充阶段并行处理。厂商把这种不对称计入价格:输出通常是输入价的 3-6 倍。长回复类任务(写作、代码生成)成本由输出主导,长上下文摘要类任务则由输入主导。
- 开源权重模型走 API 更便宜吗?
- 按 token 计通常更便宜——DeepSeek、Kimi、Qwen 等开源模型有多家供应商竞争托管,价格被压得很低。但具体任务的质量表现各异;用量极大时自托管可能更省。可先用本站「大模型显存计算器」看看模型需要什么硬件再做对比。
- 价格包含长上下文加价或限时优惠吗?
- 如果厂商在某个上下文阈值以上加价、或有限时首发价,我们会在模型旁边注明,而不是悄悄平均进去。表头数字始终是标准档,保证各模型可比。
- 我的用量数据会被上传吗?
- 不会。计算器是纯前端 JavaScript——价格表随页面打包,所有计算都在浏览器本地完成。无需注册、无上传、不记录你的输入。