同样的需求,11 个模型:差价 200 倍,贵的不一定好
同样的需求,11 个模型:差价 200 倍,贵的不一定好
你让 AI 给你搭一个咖啡店官网。就一页:营业时间、地址、菜单、一张照片。
Claude Opus 5 平均烧掉 519 积分。DeepSeek V4 Flash 只要 2.4 积分。同一个 prompt,差了 200 多倍。
这是 Netlify 最近真干的事。他们刚跟 OpenRouter 合作,接进来一堆新模型。顺手拿同一个 prompt,把 11 个模型各跑三遍,看看到底差在哪。结论比想象中有意思——真正的差距不在质量,在价格。
他们到底测了什么
Netlify 给 11 个模型喂的是同一个任务:建一个社区咖啡店的单页网站。需求写得很直白——"上面这些内容只有我自己改才会变",意思就是别整花活,别上 CMS。
每个模型跑三遍,结果全部挂出来,你可以直接点进去看真实的生成页面。这比"A 模型在 XX 榜单上比 B 高 2 分"的评测实在多了——你看到的是真东西。
顺带一提,Netlify 内部其实有套自动评估工具叫 AXIS,最近还开源了。但这次他们没走那套严格评分,就是让你亲眼看看:花不同价钱,拿到手的到底长什么样。
价格差 200 倍,但贵不等于好
先把价格摆出来。同样是咖啡店这个需求,11 个模型的平均积分消耗:
- Claude Opus 5:519 积分
- Claude Sonnet 5:143
- GPT 5.6 Sol(低思考档):141
- Gemini 3.6 Flash:103
- Kimi K3:102
- Gemini 3.1 Pro:53
- GPT 5.6 Terra:39
- DeepSeek V4 Pro:37
- GLM 5.2:27
- Kimi K2.7 Code:19
- DeepSeek V4 Flash:2.4
最贵的 Opus 5 和最便宜的 DeepSeek V4 Flash,差了 200 多倍。
更值得玩味的是 Opus 5 自己的发挥。三遍里有一遍,它烧了 1,055 积分——是其他任何一次跑量的四倍。结果呢?确实做得不错,细节足,暗黑模式开箱即用。但你要问值不值这四倍的钱,Netlify 自己都说"见仁见智"。
他们还在报告里补了句实话:Opus 5 有个毛病,经常失控地烧积分,比自己的正常基线高出一大截。这不保证结果更好,也不保证更差,就是"发生了,还挺频繁"。
便宜的那头,有惊喜也有坑
别急着下结论说"贵的都是智商税"。低价区有惊喜,也有代价。
DeepSeek V4 Flash 只花 2.4 积分,Kimi K2.7 Code 花 19 积分——小到可以忽略。对个人开发者来说,这意味着你可以用几乎零成本,把同一个需求在好几个便宜模型上各跑一遍,挑个顺眼的。
代价在哪?报告说得很实在:便宜模型在向量图形这类"重活"上明显吃力,做出来的东西"你不会真的拿去上生产"。省下来的钱,是拿能力边界换的。
这就像请设计师报价:同一个需求,有人收 5 万有人收 500。收 5 万的不一定画得更好,但收 500 的,大概率有些活接不了。
连"测智力"这件事,本身也靠不住
你可能会想:那我直接看 benchmark 分数,谁高选谁不就行了。
没那么简单。Anthropic 这周刚发了个"概念推理指数"(CRI),号称要把"推理能力"从玄学变成可量化的数字。数据很漂亮:Claude 3.7 Sonnet 只有 28%,Opus 5 有 73.6%,差距一目了然。
但注意一件事——这个 benchmark 是 Anthropic 自己出题、自己测的,没有第三方验证。而且它测的是"概念推理"(哲学、决策论那一类),不是你天天要的代码生成、工具调用。拿它当唯一标准选模型,等于用百米成绩选马拉松选手。
benchmark 能给你一个粗略的参考系,但别让任何一个数字替你拍板。尤其是厂商自己发的。
那到底该怎么选
把 Netlify 这份报告读下来,我的结论是三句话:
第一,先算账。同一份需求,价格能差 200 倍,这是最容易忽略、却最影响成本的一点。把价格放进你的决策里,别只看能力。
第二,跑你自己的任务。Netlify 测的是咖啡店网站,不是你的项目。模型在 A 场景强,不代表在 B 场景强。花十分钟,拿你手头的真实需求跑三个不同价位的模型。
第三,别迷信贵。Opus 5 烧 1,055 积分那次证明了:贵和好之间没有必然关系。性价比最优解,往往在中间价位。
你今天可以做的事
挑一个你手头的真实开发任务——写个函数、搭个页面、review 一段代码都行。用三个不同价位的模型各跑一遍,记下各自花了多少钱、结果能不能直接用。
这一趟下来,你对"该用哪个模型"的判断,会比读十篇评测更准。
参考来源:
- Netlify: More models, more choice: Comparing 11 different AI models — https://www.netlify.com/blog/one-prompt-11-models-very-different-results/
- Anthropic: Introducing the Conceptual Reasoning Index — https://alignment.anthropic.com/2026/conceptual-reasoning-index/
✨ 本文由 DeepSeek 生成初稿,Claude 审核润色。