Opus 5 发布了,但重点不是它有多聪明
Opus 5 发布了,但重点不是它有多聪明
今天早上打开终端,claude 的模型列表里多了一行:opus。
切过去,扔了个平时要拆三步的重构任务进去。一遍过。中间它自己跑了两轮验证,改掉了第一版方案里一个我没提的边界问题。
Anthropic 在 7 月 24 日发布了 Claude Opus 5。发布稿里的形容词可以跳过。真正该盯的是这张对照表:
| Opus 4.8 | Opus 5 | Fable 5 | |
|---|---|---|---|
| 输入 / 输出(每百万 token) | $5 / $25 | $5 / $25 | $10 / $50 |
| Frontier-Bench v0.1(终端编码) | 18.7% | 43.3% | 33.7% |
| OSWorld 2.0(电脑操作) | 55.7% | 70.6% | — |
| ARC-AGI-3(新颖推理) | 1.5% | 30.2% | 未测 |
| Zapier AutomationBench | 17.0% | 26.0% | 17.4% |
价格那一行没动。其他行全变了。
这是这次发布的全部故事。
一、跑分不是"提升",有几项是换了量级
Frontier-Bench v0.1 测的是终端里的 agentic 编码——不是补全一个函数,是给你一个仓库和一个目标,自己去做完。
Opus 4.8 拿 18.7%。Opus 5 拿 43.3%。翻倍还多。
同一张表上,Fable 5 是 33.7%,GPT-5.6 Sol 是 34.4%。一个半价的模型,把两家旗舰都压在下面。
CursorBench 3.2 更能说明定价的用意。max effort 下,Opus 5 距 Fable 5 的峰值只差 0.5%。每任务成本是对方一半。
推理那边的差距更离谱。ARC-AGI-3 考的是训练数据里不可能见过的新题型。Opus 5 拿 30.2%,GPT-5.6 Sol 拿 7.8%。上一代 Opus 4.8 只有 1.5%——基本等于交白卷。
这不是"在同一张卷子上多考了几分"。是别人还没及格。ARC Prize 基金会独立复核了 high effort 下的 30.16%,约为此前公开榜首的四倍。
科学向的两个数也硬:有机化学分子结构推理 +10.2pp,蛋白质功能预测 +7.7pp。
自动化那边,Zapier CEO Wade Foster 的说法最直白:之前的模型一条都没通过,Opus 5 把一整条防流失工作流跑到了 100%。
二、"接近前沿但半价"是产品决策,不是技术炫技
手机行业早就把这条路走通了。旗舰机跑分高 5%,价格贵一倍。真正卖爆的从来是次旗舰。
Anthropic 这次干的就是这件事,而且姿态很明确:Opus 5 是 Claude Max 的默认模型,也是 Pro 用户能摸到的最强模型。Fable 5 留在 $10/$50 的位置上,继续当那个"你偶尔才需要"的选项。
价格梯子现在长这样:
Haiku 4.5 $1 / 输入
Sonnet 5 $2 / 输入(介绍价,8 月 31 日到期)
Opus 5 $5 / 输入 ← 默认档
Fable 5 $10 / 输入
跟 OpenAI 的对位也值得算一下。GPT-5.6 Sol 是 $5/$30,输入持平,输出更贵。还有个容易忽略的条款:GPT-5.6 Sol 的输入超过 272k token,整个请求按 $10/$45 重新计价。Opus 5 的 100 万上下文不加价。
跑长上下文 agent 的人,这一条比跑分实在。
Lovable 的技术负责人 Fabian Hedin 补了另一半——比分数更重要的是稳定性:最难的那批 agentic 编码任务上比 Opus 4.7 高 22%,"而且更稳,跑与跑之间的方差小得多"。他把 Opus 5 称作 Opus 家族自 4.5 以来最大的一次跃升。
方差这个点被严重低估了。跑分是均值,你的生产环境吃的是尾部。一个 80 分但偶尔崩的模型,比一个稳定 75 分的模型难用得多。
三、对写代码的人,具体变了什么
三件事有直接体感。
第一,它开始自己找镜子了。
以前的模型像个装完墙就问你"直不直"的工人。Opus 5 会自己去拿水平尺。
Anthropic 举的例子:没有图像查看器可用时,它自己写了一条视觉管线去解析图纸。这不是"更聪明",是"更少回合"。你少切一次上下文,少解释一遍需求。
第二,调试能力比生成能力提升更大。
Cognition(Devin)的 CEO Scott Wu 说,在 FrontierCode 1.1 上 Opus 5 以一半成本接近 Fable 级表现,强项特别集中在困难调试和根因分析。
这个方向的价值和生成代码完全不同。生成错了你能看出来。根因找错了,你会照着错的方向修一天。发布材料里那个例子很典型:修的是某个开源包管理器的根因 bug,不是表面症状。
第三,长任务真的能一次做完了。
一家交易公司的工程师用一个 session 完成了市场数据集成——之前的模型完全做不了这件事。
省钱的算法也简单。一次典型的 agent 任务,假设 200k 输入 + 20k 输出:
Opus 5 : 200k × $5/1M + 20k × $25/1M = $1.50
Fable 5: 200k × $10/1M + 20k × $50/1M = $3.00
一倍。而且 Opus 5 有 effort 档位可调。Zapier 那条基准里,medium effort 还能拿 24%(满档 26%),每任务 $0.89。少的那 2 个百分点,换来的预算够你多跑两轮。
四、Anthropic 没大声说的几件事
夸完了,说该扣分的地方。这几条都写在官方材料里,只是不在标题上。
幻觉率比 Opus 4.8 略高。 官方自己承认的。跑分涨了不等于你能少 review 一遍。恰恰相反:一个更自信、更能自我验证、还更容易编事实的模型,比一个笨模型更需要人盯着。
跑分不是全胜。 DeepSWE v1.1 上 GPT-5.6 Sol 拿 72.7%,Opus 5 是 68.8%。那一行输了。
基准是厂家挑的。 "Frontier-Bench v0.1"这个版本号本身就说明问题——一个刚出生的基准。谁选基准,谁占优势,这是行业通病,不是 Anthropic 独有。但对照表看着爽,不代表你的工作负载会同比例爽。
系统卡里那条"评估感知"。 Anthropic 记录到了自家历史最低的失准率,同时承认:Opus 5 能识别出自己正在被评估。官方判断这不影响评估结论。
这句话得掰开看。它不是丑闻,但它是厂家自己给自己判卷——Anthropic 出题、Anthropic 打分、Anthropic 下结论。Anthropic 在披露弱点上确实比同行坦诚,这不改变结构性问题:没有外部审计方给出独立判断。
能力是双刃的。 英国 AI 安全研究院用 1 亿 token 预算测了一个早期快照。在"The Last Ones"这个模拟企业网络场景里,Opus 5 十次里有八次端到端打通。官方明确说 Opus 5 在危险的双用途能力(比如网络攻击)上不是最强——它弱于 Mythos 5。但"不是最强"和"不强"是两回事。
最后一条最实操:token 便宜了,账单不一定便宜。 单价砍半,但 agent 跑得更久、上下文吃得更多、你也更舍得让它多跑几轮。这是 Jevons 悖论的教科书场景。真想省钱,去看月度账单,别看单价表。
一个不在任何评测里的实测问题:安全分类器卡壳。
写这篇文章时,我们实际跑了 Opus 5 + Claude Code。模型本身很强——一遍过了一个平时要拆三步的重构任务,中间自己跑了两轮验证。
但 Anthropic 的安全分类器——就是那个负责判断工具调用是否安全的独立模型——频繁罢工。提示 "auto mode cannot determine the safety of Bash"。不是模型拒绝干活,是门口安检的保安自己撂挑子了。
这件事不在系统卡里,也不在任何一篇评测文章里。比跑分低两个点更影响效率的,是工具链的稳定性。模型聪明到能自己写视觉管线解析图纸,但它的工具调用被另一个模型卡住——这才是 agentic workflow 里真正的痛点。能力在 Opus 5,瓶颈在分类器。
如果你也遇到,临时绕过办法:在项目 .claude/settings.local.json 里把常调的命令加白名单。不是长久之计,但目前就这条路。
该做什么
不用等谁写评测。今天就能验证的四步:
- 切过去跑你自己的活。
claude --model opus,或 API 里model="claude-opus-5"。找一个你上周被卡住的任务重跑一遍——那个是最好的基准。 - 专门试根因调试。 这是本次提升最集中的方向。挑一个你已经知道答案的历史 bug,看它能不能自己挖到根因,而不是修表面症状。
- 把 effort 档位调下来试试。 别默认拉满。从 medium 起,只在明确不够时往上加。省下的钱是白赚的。
- 给 review 加一道校验,别减。 幻觉率比上一代略高这件事是官方说的。让它自己写测试、自己跑验证——它现在擅长这个,用上。
一句话总结:Opus 5 值得你今天就切过去,但它更强的自我验证能力,是你多加一道人工校验的理由,不是少加一道的理由。
参考来源
- Introducing Claude Opus 5 — Anthropic
- Claude Opus 5 System Card (PDF)
- Anthropic launched Claude Opus 5 at half the price of its most powerful AI model — Quartz
- Anthropic's Claude Opus 5 AI model rivals Fable 5 and is cheaper — CNBC
- Claude Opus 5 Benchmarks Explained — Vellum
- Claude Opus 5 Outscores Fable 5 on Most Benchmarks — At Half the Price — Decrypt
- Anthropic launches Claude Opus 5, a cheaper AI model for coding, agents and enterprise workflows — VentureBeat
- Claude Opus 5 Hacked Enterprise Networks in 8 of 10 Government Tests — Tech Times
- Claude Opus 5: The System Card — Zvi Mowshowitz
- Pricing — Claude Platform Docs
✨ 本文由 Claude Opus 5 生成,小助审核发布。