DeepSeek V4 Pro vs Flash 实测:多花 12 倍的推理能力值吗?
DeepSeek V4 Pro vs Flash 实测:多花 12 倍的推理能力值吗?
上周我把 DeepSeek V4 Flash 和 Pro 拉出来对着跑了 5 组题:逻辑推理、长上下文、工具规划、代码修复、指令遵循——全是 agent 每天真会碰上的活儿。同 prompt,同参数(temperature 0.3),唯一变量就是模型。
结论先放这里:Pro 在长任务上确实值这个钱,但 Flash 有个坑你多半已经踩过、只是没意识到。
价格差在哪?
两个模型纸面参数几乎一样:都是 100 万 token 上下文窗口,38.4 万 token 输出上限,都支持 reasoning。唯一的区别在价格:
- Flash:输入 $0.14/百万 token,输出 $0.28/百万 token
- Pro:输入 $1.74/百万 token,输出 $3.48/百万 token
Pro 贵 12.4 倍。钱能买来什么?看实测。
五组硬核实测
1. 多步逻辑推理:Flash 意外赢了
题目是一个经典的排列推理题——5 个盒子、5 种球、5 条线索。需要枚举排除法才能解。
Flash 117 秒交卷,答案是对的:这题根本没有唯一解,有 5 种合法排列。Pro 呢?442 秒还在绕,输出被 max_tokens 硬生生截断。
Flash 的推理能力比我预期强不少。Pro 栽在了反面——它不知道什么时候该收手。
2. 长上下文信息提取:Pro 完胜
我塞给两个模型一份虚构的电商事故报告:6 个关键事实、3 个数字、还埋了个日期陷阱,要求提取 3 组精确数据。这就是 agent 跑到第十轮之后的典型上下文形态。
Pro 51.6 秒交卷,答案干净——3,211 单无法恢复(其中 890 单来自 channel=2),回滚方案 A。全对。
Flash 直接崩了。8000 token 的上限,reasoning 一个人吃光了全部配额,答案一个字没打出来。
我把上限放开到 32000 再试一次,这回它答对了。代价是 148.8 秒、4.5 万字符的内心戏,答案啰嗦程度是 Pro 的两倍。
放到 agent 长任务里,这个差别很要命:上下文本来就挤,Flash 的 reasoning 会把有效答案顶出去。
3. 工具调用规划:Pro 的专业度碾压
要求规划一个完整的运维任务:统计 nginx 日志里最近 30 天的 5xx 错误请求数,按天分组,找前 3 个出错最多的 URL。
Pro 的方案挑不出毛病:find + xargs + zcat 兜住压缩日志,awk 内嵌 mktime 解析自定义时间格式,sort + uniq + head 出 Top 3。每一步都写了为什么这么选、备选方案是什么。
Flash 又被 8000 token 卡死,零输出。
4. 代码 Bug 修复:Pro 精准命中最隐蔽的问题
一个看起来完全正确的合并区间函数,要求找 bug、给修复、写边界用例。
Pro 127 秒命中要害:list.sort() 就地排序,悄悄改掉了调用者的原始数据。这是那种上线后才发现"我明明没改它啊"的坑。它还配了个边界用例,打印调用前后的原始列表,一眼就能看出问题。
Flash 第三次被 8000 token 噎死,零输出。
5. 指令遵循:平手
写一封英文退款邮件,5 条硬约束:Subject 不超过 8 词、3 段每段不超过 2 句、写明金额、写明时效、指定署名。两个都合格。
Flash 4.1 秒搞定,Pro 花了 32 秒,文笔确实更自然一点。但为这点文笔差多掏 12 倍的钱,不值。
隐藏坑:Flash 的 Token 黑洞
这组评测暴露了 Flash 最致命的问题:reasoning token 消耗异常大。
同样是 8000 token 上限,Pro 在 5 题中完整回答了 4 题,平均输出 3000-6000 token。Flash 在 3 题中完全空输出——reasoning 吃光了全部配额,连一个字都没给答案。
这不是"Flash 不会",是"Flash 想得太啰嗦"。你要给它 2-3 倍的 token 预算才能拿到等同质量的答案。而 agent 长任务的上下文窗口本来就不富裕——越到后面越挤。Flash 的 reasoning 膨胀在这个场景下就是定时炸弹。
具体数字:
| 场景 | Flash reasoning | Pro reasoning | 差距 |
|---|---|---|---|
| 长上下文 | 45,426 字符 | 839 字符 | 54x |
| 工具规划 | 被截断 | 3,514 字符 | — |
| 代码修复 | 被截断 | 5,251 字符 | — |
你没看错,同一个长上下文提取任务,Flash 的 reasoning 是 Pro 的 54 倍。Pro 用不到 1000 个 token 就想清楚了,Flash 要写 4.5 万字的内心独白。
那该用哪个?
Flash 适合:
- 简单问答、短回复、指令遵循
- 你确定不超 8-10 轮对话的短会话
- 成本敏感的场景(便宜 12 倍是硬道理)
Pro 适合:
- Agent 长任务(多步推理、跨轮上下文积累)
- 代码分析、工具规划、bug 修复
- 任何需要"想得准、字少"的场景
还有一个反常识的结论:相同任务,Pro 的实际成本倍数比标价小得多。 因为 Pro 输出更精炼——长上下文题 Pro 只用了 2,433 token 就答完,Flash 要花 14,775 token。输出成本 Pro 贵 12.4 倍,但 token 用量 Flash 是 Pro 的 6 倍,实际差价大概在 2-4 倍左右。
你今天可以做的事
在 OpenClaw 里直接切模型试试:
/model deepseek/deepseek-v4-pro
然后跑一个你自己实际会遇上的长任务——比如让 agent 读一个项目的 5 个文件后改代码。感受一下 Pro 和 Flash 在真实工作流里的差异。测完你会明白"多花 2 倍的钱买 50% 提升"到底值不值。
✨ 本文基于 5 组 agent 场景实测评测得撰写。评测环境:DeepSeek V4 Flash/Pro API,temperature 0.2-0.3,max_tokens 8000-32000。数据来源:作者实测。
✨ 本文由 DeepSeek 生成初稿,Claude 审核润色。