LLM API Pricing Calculator
Compare current API prices for Claude, GPT, Gemini, DeepSeek, Kimi, Grok and other LLMs, and estimate your monthly bill from token volume. Includes prompt-caching prices and batch discounts that most comparison tables miss. Prices last verified 2026-07-27. Runs entirely in your browser — no upload, no signup.
Share of input tokens served from prompt cache
| Model | Input $/M | Output $/M | Cached $/M | Context | Est. monthly |
|---|---|---|---|---|---|
DeepSeek V4 Flash DeepSeek · open-weight | $0.14 | $0.28 | $0.0028 | 1M | $9.80 |
Gemini 3.1 Flash-Lite | $0.25 | $1.5 | $0.025 | 1M | $27.50 |
DeepSeek V4 Pro DeepSeek · open-weight | $0.435 | $0.87 | $0.003625 | 1M | $30.45 |
GPT-5 mini OpenAI | $0.25 | $2 | $0.025 | 400K | $32.50 |
GLM-5 Zhipu (z.ai) · open-weight | $1 | $3.2 | $0.2 | 200K | $82.00 |
Grok 4.20 xAI | $1.25 | $2.5 | $0.2 | 1M | $87.50 |
Kimi K2.7 Code Moonshot · open-weight | $0.95 | $4 | $0.19 | 262K | $87.50 |
Claude Haiku 4.5 Anthropic | $1 | $5 | $0.1 | 200K | $100 |
GPT-5.6 luna OpenAI | $1 | $6 | $0.1 | 1.05M | $110 |
GLM-5.2 Zhipu (z.ai) · open-weight | $1.4 | $4.4 | $0.26 | 200K | $114 |
Gemini 3.6 Flash | $1.5 | $7.5 | $0.15 | 1M | $150 |
Grok 4.5 xAI | $2 | $6 | $0.3 | 500K | $160 |
Claude Sonnet 5 Anthropic | $2 | $10 | $0.2 | 1M | $200 |
Gemini 3.1 Pro Preview | $2 | $12 | $0.2 | 1M | $220 |
GPT-5.6 terra OpenAI | $2.5 | $15 | $0.25 | 1.05M | $275 |
Kimi K3 Moonshot · open-weight | $3 | $15 | $0.3 | 1.048576M | $300 |
Claude Opus 5 Anthropic | $5 | $25 | $0.5 | 1M | $500 |
GPT-5.6 sol OpenAI | $5 | $30 | $0.5 | 1.05M | $550 |
Claude Fable 5 Anthropic | $10 | $50 | $1 | 1M | $1000 |
Prices are per 1 million tokens in USD, standard (non-batch) tier, verified 2026-07-27 against official pricing pages. Claude Sonnet 5: Intro price through Aug 31, 2026; $3 / $15 after. GPT-5.6 sol: Requests beyond the long-context threshold bill at 2× input / 1.5× output. Gemini 3.1 Pro Preview: Prompts over 200K tokens bill at $4 / $18. Grok 4.5: Requests over 200K tokens bill at 2×. Kimi K3: Always-on reasoning; output includes thinking tokens.
Batch discount is applied only to models whose provider offers an async batch tier. Cached-input pricing models the read price; cache-write surcharges (Anthropic) are not included. Long-context surcharges apply above provider thresholds and are noted per model.
使用指南 / 为什么使用此工具 / 常见问题
使用指南
输入你预计的月度 token 用量——输入 token 和输出 token(以百万计)。可选设置提示词缓存命中率(按更便宜的缓存价计费的输入 token 占比),以及是否启用异步 Batch API 折扣。表格会立即按估算月成本对所有模型排序,最便宜的高亮显示。可在闭源模型和开源权重模型之间筛选,并一键复制整个对比结果。每个价格都标注了对照官方定价页核实的日期。
为什么使用此工具
大模型 API 价格变化极快——每月都有新模型发布,厂商一年调价数次,搜索结果里的对比表大多已经过时。本计算器对照官方定价页维护,并把简单表格忽略的部分算进去:提示词缓存读取价(常常比普通输入便宜 10 倍)、异步批量折扣、以及输出 token 通常是输入价 3-6 倍这一事实。适合在选型前对比各家价格、用真实流量估算生产预算、或评估换模型/加缓存能省多少钱。如果你也在考虑自托管开源模型,可配合本站「大模型显存计算器」对比 API 成本与自建 GPU 成本。
常见问题
- 月成本是怎么计算的?
- 成本 = 未命中缓存的输入 token × 输入价 + 命中缓存的输入 token × 缓存价 + 输出 token × 输出价(均按每百万 token 计)。启用 Batch API 后,对提供异步批量档的厂商再应用相应折扣(通常 5 折)。
- 价格数据有多新?
- 每个价格都对照厂商官方定价页核实,页面上标注核实日期。厂商调价或发布新模型时我们会更新表格——保鲜正是这个工具存在的意义,搜索结果里的价格对比大多已过期数月。
- 什么是提示词缓存,为什么重要?
- 厂商允许缓存重复的提示词前缀(系统提示、长文档、few-shot 示例),后续请求复用时按远低于普通输入的价格计费——通常只有正常价的 10% 左右。对每轮都重发大量上下文的聊天机器人和 Agent 来说,高缓存命中率能把输入成本降一个数量级,所以本计算器把它显式建模。
- Batch API 折扣是什么?
- 多数主流厂商提供异步批量档:一次提交大量请求,在时间窗口内(通常 24 小时)返回结果,输入输出 token 都按约半价计费。适合评测跑分、向量回填、批量内容处理等离线任务。
- 为什么输出 token 比输入贵?
- 生成每个 token 都需要一次完整前向计算,而输入 token 在预填充阶段并行处理。厂商把这种不对称计入价格:输出通常是输入价的 3-6 倍。长回复类任务(写作、代码生成)成本由输出主导,长上下文摘要类任务则由输入主导。
- 开源权重模型走 API 更便宜吗?
- 按 token 计通常更便宜——DeepSeek、Kimi、Qwen 等开源模型有多家供应商竞争托管,价格被压得很低。但具体任务的质量表现各异;用量极大时自托管可能更省。可先用本站「大模型显存计算器」看看模型需要什么硬件再做对比。
- 价格包含长上下文加价或限时优惠吗?
- 如果厂商在某个上下文阈值以上加价、或有限时首发价,我们会在模型旁边注明,而不是悄悄平均进去。表头数字始终是标准档,保证各模型可比。
- 我的用量数据会被上传吗?
- 不会。计算器是纯前端 JavaScript——价格表随页面打包,所有计算都在浏览器本地完成。无需注册、无上传、不记录你的输入。