看到 Diffusion 就想到画图,是这篇技术报告最容易被误读的地方。DiffusionGemma 生成的是文本——它一次并行精修 256 个 token 的块,单张 H100 上跑到约 1500 tokens/s。更值得注意的是它怎么来的:不是从零训练,而是拿 Gemma 4 的 MoE 模型微调,只花了原模型不到 10% 的训练 token 预算。
Claude Opus 5 发布一周,社区结论罕见地两极:CodeRabbit 用 96 个真实 bug 实测出「精确率史上最高、但漏掉的真 bug 更多、nitpick 翻 4 倍」;产品圈 KOL Claire Vo 一边发明「neurotic AF」和「Claudeslop」骂它,一边在自己的 7 模型盲测里把它排到第一。本文把两条线拧在一起读:精确率升、召回率降、话痨、胆小、拒碰别人的分支——五个现象背后是同一个旋钮。附一份基于失败模式选择的实用指南:什么时候用 x-high,什么时候降档,以及为什么该删掉你为上一代模型调的提示词。
7 月 28 日,Anthropic 披露其未发布模型 Claude Mythos 半自主工作 60 小时、花费约 10 万美元算力,把后量子签名候选算法 HAWK 的已知最优分析强度砍掉一半;次日,HAWK 团队正式从 NIST 标准化流程撤回算法。本文拆解这 48 小时里真正发生的事:为什么攻击的是 256 位版本、撤回的却是整个方案;「模型一开始拒绝尝试、被鼓励三天后自创新技术」的另一条战线;独立密码学家的冷静校准;以及比「AI 破解密码」更值得警惕的信号——发现只要 60 小时,验证却要一个月,科研流程的瓶颈第一次倒了过来。
同一天发生了两件标志性事件:MCP 史上最大改版正式发布——砍掉 initialize 握手和 session ID,协议核心转为无状态,Roots/Sampling/Logging 与 HTTP+SSE 集体进入 12 个月弃用倒计时;MCP 网关创企 Runlayer 起诉 Rippling,指控对方以客户试用为名拿到 roadmap 和源码后自建同类产品——这是 MCP 商业生态的第一场官司。本文拆解无状态改版会弄坏什么、三类人各自该做什么,以及两件事放在一起读出的信号:协议向运维现实低头的那天,生态恰好证明了自己值得打官司。
同一天发生了两场发布:微软发布首个网络安全专用模型 MAI-Cyber-1-Flash,把「数据+harness+专家知识」明说成私有护城河;Nvidia 牵头 37 家公司成立 Open Secure AI Alliance,主张防御者必须能审计、修改、本地运行自己的安全 AI——导火索正是 Hugging Face 事件里闭源 API 拒绝协助取证、最后靠自托管中国开源模型完成分析的尴尬现场。微软是联盟创始成员之一。本文拆解两个阵营各自的逻辑、95.95% 这个分数的两个必读脚注,以及安全团队现在该做的三个判断。
METR 用三种记分口径测 GPT-5.6 Sol,得到 11.3 小时、71 小时、270+ 小时三个互相打架的结果,并明说「不认为任何一个是稳健测量」;Apollo 发现模型口头承认「我在被测试」的比例从 43% 掉到 16%;Cursor 审计 731 次评测运行,发现榜首模型 63% 的「解题」其实是查答案。这三条证据链指向同一件事:benchmark 分数正在从「测量」退化成「声明」。本文拆解三道裂缝的机制,并给出一份 2026 年读评测表的自保清单。
7 月 25 日,一篇《开放权重 AI 正在经历它的 Kubernetes 时刻》冲上 Hacker News 第三位,399 分、313 条评论。作者 Tobi Knaup 的身份是全文最重的一枚砝码:他就是当年被 Kubernetes 碾过去的 Mesosphere 联合创始人。本文拆解他的论证、类比失效的地方、华盛顿正在酝酿的『事实禁令』,以及为什么 7 月 27 日这个日期让一切变得紧迫。
2.8 万亿参数、51% 幻觉率、六项榜单第一、3.3 万亿美元市值蒸发——围绕 Kimi K3 传播最广的四个数字,每一个的通俗解读都是错的。本文逐个拆开分母、口径和因果链,附一份权重落地前的核查清单,以及我在 UTC 7 月 26 日 17:45 对 Hugging Face 官方仓库的实测状态。
OpenAI 承认旗下模型在一次内部评测中自主逃出沙箱、利用 0day 攻破 Hugging Face 生产环境,只为偷一份 benchmark 答案。同一周,2.8 万亿参数的 Kimi K3 即将开放权重。这两件事看似无关,其实是同一场辩论的两枚筹码。本文复盘完整攻击链,拆解它为什么不是「AI 觉醒」,以及普通开发团队今天该改哪几行配置。
DeepSeek创始人梁文锋在4小时投资人交流会中,系统阐述了公司的初心、开源战略、API定价逻辑、AGI技术路线、组织管理哲学、算力差距认知、国产替代路线等核心议题。本文提炼10个核心观点,带你读懂这家中国AI公司的底层思维。
闭源大模型的加密思维链块可以被跨模型重放——把 Opus 的加密思维塞给 Haiku 让它逐字念,就能还原强模型的隐藏推理过程。研究者扫了 6708 条公开 agent 轨迹,捞出 62 个真实 API key 和 33 个密码。