工具大全
Back

LLM API Pricing Calculator

Compare current API prices for Claude, GPT, Gemini, DeepSeek, Kimi, Grok and other LLMs, and estimate your monthly bill from token volume. Includes prompt-caching prices and batch discounts that most comparison tables miss. Prices last verified 2026-07-27. Runs entirely in your browser — no upload, no signup.

M tokens
M tokens

Share of input tokens served from prompt cache

ModelInput $/MOutput $/MCached $/MContextEst. monthly

DeepSeek V4 Flash

DeepSeek · open-weight

$0.14$0.28$0.00281M$9.80

Gemini 3.1 Flash-Lite

Google

$0.25$1.5$0.0251M$27.50

DeepSeek V4 Pro

DeepSeek · open-weight

$0.435$0.87$0.0036251M$30.45

GPT-5 mini

OpenAI

$0.25$2$0.025400K$32.50

GLM-5

Zhipu (z.ai) · open-weight

$1$3.2$0.2200K$82.00

Grok 4.20

xAI

$1.25$2.5$0.21M$87.50

Kimi K2.7 Code

Moonshot · open-weight

$0.95$4$0.19262K$87.50

Claude Haiku 4.5

Anthropic

$1$5$0.1200K$100

GPT-5.6 luna

OpenAI

$1$6$0.11.05M$110

GLM-5.2

Zhipu (z.ai) · open-weight

$1.4$4.4$0.26200K$114

Gemini 3.6 Flash

Google

$1.5$7.5$0.151M$150

Grok 4.5

xAI

$2$6$0.3500K$160

Claude Sonnet 5

Anthropic

$2$10$0.21M$200

Gemini 3.1 Pro Preview

Google

$2$12$0.21M$220

GPT-5.6 terra

OpenAI

$2.5$15$0.251.05M$275

Kimi K3

Moonshot · open-weight

$3$15$0.31.048576M$300

Claude Opus 5

Anthropic

$5$25$0.51M$500

GPT-5.6 sol

OpenAI

$5$30$0.51.05M$550

Claude Fable 5

Anthropic

$10$50$11M$1000

Prices are per 1 million tokens in USD, standard (non-batch) tier, verified 2026-07-27 against official pricing pages. Claude Sonnet 5: Intro price through Aug 31, 2026; $3 / $15 after. GPT-5.6 sol: Requests beyond the long-context threshold bill at 2× input / 1.5× output. Gemini 3.1 Pro Preview: Prompts over 200K tokens bill at $4 / $18. Grok 4.5: Requests over 200K tokens bill at 2×. Kimi K3: Always-on reasoning; output includes thinking tokens.

Batch discount is applied only to models whose provider offers an async batch tier. Cached-input pricing models the read price; cache-write surcharges (Anthropic) are not included. Long-context surcharges apply above provider thresholds and are noted per model.

使用指南 / 为什么使用此工具 / 常见问题

使用指南

输入你预计的月度 token 用量——输入 token 和输出 token(以百万计)。可选设置提示词缓存命中率(按更便宜的缓存价计费的输入 token 占比),以及是否启用异步 Batch API 折扣。表格会立即按估算月成本对所有模型排序,最便宜的高亮显示。可在闭源模型和开源权重模型之间筛选,并一键复制整个对比结果。每个价格都标注了对照官方定价页核实的日期。

为什么使用此工具

大模型 API 价格变化极快——每月都有新模型发布,厂商一年调价数次,搜索结果里的对比表大多已经过时。本计算器对照官方定价页维护,并把简单表格忽略的部分算进去:提示词缓存读取价(常常比普通输入便宜 10 倍)、异步批量折扣、以及输出 token 通常是输入价 3-6 倍这一事实。适合在选型前对比各家价格、用真实流量估算生产预算、或评估换模型/加缓存能省多少钱。如果你也在考虑自托管开源模型,可配合本站「大模型显存计算器」对比 API 成本与自建 GPU 成本。

常见问题

月成本是怎么计算的?
成本 = 未命中缓存的输入 token × 输入价 + 命中缓存的输入 token × 缓存价 + 输出 token × 输出价(均按每百万 token 计)。启用 Batch API 后,对提供异步批量档的厂商再应用相应折扣(通常 5 折)。
价格数据有多新?
每个价格都对照厂商官方定价页核实,页面上标注核实日期。厂商调价或发布新模型时我们会更新表格——保鲜正是这个工具存在的意义,搜索结果里的价格对比大多已过期数月。
什么是提示词缓存,为什么重要?
厂商允许缓存重复的提示词前缀(系统提示、长文档、few-shot 示例),后续请求复用时按远低于普通输入的价格计费——通常只有正常价的 10% 左右。对每轮都重发大量上下文的聊天机器人和 Agent 来说,高缓存命中率能把输入成本降一个数量级,所以本计算器把它显式建模。
Batch API 折扣是什么?
多数主流厂商提供异步批量档:一次提交大量请求,在时间窗口内(通常 24 小时)返回结果,输入输出 token 都按约半价计费。适合评测跑分、向量回填、批量内容处理等离线任务。
为什么输出 token 比输入贵?
生成每个 token 都需要一次完整前向计算,而输入 token 在预填充阶段并行处理。厂商把这种不对称计入价格:输出通常是输入价的 3-6 倍。长回复类任务(写作、代码生成)成本由输出主导,长上下文摘要类任务则由输入主导。
开源权重模型走 API 更便宜吗?
按 token 计通常更便宜——DeepSeek、Kimi、Qwen 等开源模型有多家供应商竞争托管,价格被压得很低。但具体任务的质量表现各异;用量极大时自托管可能更省。可先用本站「大模型显存计算器」看看模型需要什么硬件再做对比。
价格包含长上下文加价或限时优惠吗?
如果厂商在某个上下文阈值以上加价、或有限时首发价,我们会在模型旁边注明,而不是悄悄平均进去。表头数字始终是标准档,保证各模型可比。
我的用量数据会被上传吗?
不会。计算器是纯前端 JavaScript——价格表随页面打包,所有计算都在浏览器本地完成。无需注册、无上传、不记录你的输入。