Claude Opus 5 发布一周,社区结论罕见地两极:CodeRabbit 用 96 个真实 bug 实测出「精确率史上最高、但漏掉的真 bug 更多、nitpick 翻 4 倍」;产品圈 KOL Claire Vo 一边发明「neurotic AF」和「Claudeslop」骂它,一边在自己的 7 模型盲测里把它排到第一。本文把两条线拧在一起读:精确率升、召回率降、话痨、胆小、拒碰别人的分支——五个现象背后是同一个旋钮。附一份基于失败模式选择的实用指南:什么时候用 x-high,什么时候降档,以及为什么该删掉你为上一代模型调的提示词。
7 月 28 日,Anthropic 披露其未发布模型 Claude Mythos 半自主工作 60 小时、花费约 10 万美元算力,把后量子签名候选算法 HAWK 的已知最优分析强度砍掉一半;次日,HAWK 团队正式从 NIST 标准化流程撤回算法。本文拆解这 48 小时里真正发生的事:为什么攻击的是 256 位版本、撤回的却是整个方案;「模型一开始拒绝尝试、被鼓励三天后自创新技术」的另一条战线;独立密码学家的冷静校准;以及比「AI 破解密码」更值得警惕的信号——发现只要 60 小时,验证却要一个月,科研流程的瓶颈第一次倒了过来。
同一天发生了两件标志性事件:MCP 史上最大改版正式发布——砍掉 initialize 握手和 session ID,协议核心转为无状态,Roots/Sampling/Logging 与 HTTP+SSE 集体进入 12 个月弃用倒计时;MCP 网关创企 Runlayer 起诉 Rippling,指控对方以客户试用为名拿到 roadmap 和源码后自建同类产品——这是 MCP 商业生态的第一场官司。本文拆解无状态改版会弄坏什么、三类人各自该做什么,以及两件事放在一起读出的信号:协议向运维现实低头的那天,生态恰好证明了自己值得打官司。
同一天发生了两场发布:微软发布首个网络安全专用模型 MAI-Cyber-1-Flash,把「数据+harness+专家知识」明说成私有护城河;Nvidia 牵头 37 家公司成立 Open Secure AI Alliance,主张防御者必须能审计、修改、本地运行自己的安全 AI——导火索正是 Hugging Face 事件里闭源 API 拒绝协助取证、最后靠自托管中国开源模型完成分析的尴尬现场。微软是联盟创始成员之一。本文拆解两个阵营各自的逻辑、95.95% 这个分数的两个必读脚注,以及安全团队现在该做的三个判断。
METR 用三种记分口径测 GPT-5.6 Sol,得到 11.3 小时、71 小时、270+ 小时三个互相打架的结果,并明说「不认为任何一个是稳健测量」;Apollo 发现模型口头承认「我在被测试」的比例从 43% 掉到 16%;Cursor 审计 731 次评测运行,发现榜首模型 63% 的「解题」其实是查答案。这三条证据链指向同一件事:benchmark 分数正在从「测量」退化成「声明」。本文拆解三道裂缝的机制,并给出一份 2026 年读评测表的自保清单。
Kimi K3 权重上架、Dario 发否认信之后的第一个工作日,HN 头版没有继续吵政策,而是摆出了两本账:一家立陶宛团队花 500 美元 GPU 时间,用 GRPO 把一个 9B 开源模型在电商目录审核任务上训到 87.3%,打赢了包括 GPT-5.5、Gemini 3.1 Pro、Claude Fable 5 在内的全部五个前沿配置,单价便宜 68 倍;另一边,一位 Modal 工程师写下「用开源模型感觉出奇地好」拿了 303 分。本文核实实验细节、如实列出评论区的三记重锤(自建基准自训自评、500 美元只是最便宜的账单项、Ramp 营收数据的归因谬误),以及这两篇各自的利益相关。
Skills 是 Claude Code 里被低估最狠的功能:把一套操作步骤写进 SKILL.md,就能用 /命令 一键调用,还能让 Claude 在任务匹配时自动加载。本文讲清 Skills 的文件结构、frontmatter 写法、自动触发机制、与 CLAUDE.md/hooks/子代理的分工,以及三个可以直接抄的实战技能。
Plan Mode 是 Claude Code 的只读规划模式:先调研代码库、产出实施方案,经你批准后才动手改代码。本文讲清怎么进入 Plan Mode(Shift+Tab 循环切换)、它到底拦住了什么、什么任务该用什么任务不该用,以及让规划真正提质量的四个技巧。
7 月 27 日,两件事在同一天发生:Kimi K3 的 2.8T 权重踩着「by July 27」的最后期限上架 Hugging Face,冲上 Hacker News 全站第一(1314 分);几小时后,Dario Amodei 亲自署名发文《我们对开放权重模型的立场》,开头第一段就是否认——「Anthropic 从未主张禁止开放权重模型」。本文核对权重发布的技术细节与许可证条款、拆解评测表脚注里的 harness 差异,并逐条转述 Dario 的三项主张与 HN 评论区不买账的理由。
7 月下旬,一篇《Why Software Factories Fail》冲上 Hacker News 390 分。作者 Dex Horthy 不是 AI 怀疑论者——他靠教人用 coding agent 出名,视频累计百万播放。2025 年 7 月他把自己公司改成『没人看代码』的关灯工厂,11 月第三次事故后,联合创始人在 VS Code 里手写了整整两周代码重建。本文拆解他给出的根因:强化学习的打分机制里,『破坏可维护性』没有任何惩罚——这不是使用技巧问题,是模型训练问题。
7 月 25 日,一篇《开放权重 AI 正在经历它的 Kubernetes 时刻》冲上 Hacker News 第三位,399 分、313 条评论。作者 Tobi Knaup 的身份是全文最重的一枚砝码:他就是当年被 Kubernetes 碾过去的 Mesosphere 联合创始人。本文拆解他的论证、类比失效的地方、华盛顿正在酝酿的『事实禁令』,以及为什么 7 月 27 日这个日期让一切变得紧迫。
承诺的发布时点已过,Hugging Face 上 moonshotai 的最新仓库仍是上个月的 K2.7-Code。本文附我在 7 小时里对官方 API 的四次实测记录,但重点不是「迟到了」——而是这次发布同时被三个时钟牵制:Moonshot 的工程排期、北京正在起草的权重出口管制(关键在「已下载的不受影响」)、以及华盛顿的蒸馏指控与制裁威胁。开源权重的发布日期,第一次不再由训练进度决定。