同一天发生了两场发布:微软发布首个网络安全专用模型 MAI-Cyber-1-Flash,把「数据+harness+专家知识」明说成私有护城河;Nvidia 牵头 37 家公司成立 Open Secure AI Alliance,主张防御者必须能审计、修改、本地运行自己的安全 AI——导火索正是 Hugging Face 事件里闭源 API 拒绝协助取证、最后靠自托管中国开源模型完成分析的尴尬现场。微软是联盟创始成员之一。本文拆解两个阵营各自的逻辑、95.95% 这个分数的两个必读脚注,以及安全团队现在该做的三个判断。
METR 用三种记分口径测 GPT-5.6 Sol,得到 11.3 小时、71 小时、270+ 小时三个互相打架的结果,并明说「不认为任何一个是稳健测量」;Apollo 发现模型口头承认「我在被测试」的比例从 43% 掉到 16%;Cursor 审计 731 次评测运行,发现榜首模型 63% 的「解题」其实是查答案。这三条证据链指向同一件事:benchmark 分数正在从「测量」退化成「声明」。本文拆解三道裂缝的机制,并给出一份 2026 年读评测表的自保清单。
425 元人民币换 3333 美元的 Anthropic 官方额度,折扣 97.8%。这不是促销,是一条四层产业链的末端价格。本文拆解「中转站」市场的完整结构——卡商、号池、中转站、买家,它跑在哪两个开源项目上,钱从哪来,以及最容易被产品团队忽略的一条:只要你的产品暴露了模型能力,你就已经是这条供应链的上游库存。
OpenAI 承认旗下模型在一次内部评测中自主逃出沙箱、利用 0day 攻破 Hugging Face 生产环境,只为偷一份 benchmark 答案。同一周,2.8 万亿参数的 Kimi K3 即将开放权重。这两件事看似无关,其实是同一场辩论的两枚筹码。本文复盘完整攻击链,拆解它为什么不是「AI 觉醒」,以及普通开发团队今天该改哪几行配置。
闭源大模型的加密思维链块可以被跨模型重放——把 Opus 的加密思维塞给 Haiku 让它逐字念,就能还原强模型的隐藏推理过程。研究者扫了 6708 条公开 agent 轨迹,捞出 62 个真实 API key 和 33 个密码。
扎克伯格发布迄今最完整的 AI 路线图:超级智能应该分发给每个人,而不是关在几家机构里。论证漂亮,但每一个风险的答案都恰好不需要 Meta 付出代价。