结论先放这里:**Pro 在长任务上确实值这个钱,但 Flash 有个坑你多半已经踩过、只是没意识到。**
同一台机器、同一个用户、同一份全局配置,两个 Claude Code 窗口里跑同一个 CLI,一个通一个不通。最像的解释是权限分类器把其中一个拦了——毕竟它确实会拦。但真相在另一层:守护进程的 plist 装好了却没被 launchd 加载,于是所有要连网关的子命令全挂,纯本地的子命令照常输出。这种「一半能跑一半不能」的形状,正是把人骗向权限假设的东西。本文记录完整排查:三个假设怎么被逐个推翻,包括我自己误读日志的那一次。
单卡4GB跑70B,还是边缘节点规模化部署小模型?AirLLM和Cloudflare给出两条推理优化路线,对比它们的取舍和适用场景。
Reasonix、ds4、Kimi K3 on MI355X——同一周三件事,指向同一个趋势:大模型正在从云端API调用变成本地常驻进程。本文从技术架构、硬件门槛和性价比三个维度拆解这场静默迁移。
GitHub 官方发布 gh-stack,把堆叠式 PR 从第三方插件变成官方工作流。本文拆解堆叠 PR 机制、为什么官方下场是大事、十分钟上手命令,以及四个不该用的场景。
给 sing-box 套 nginx 加真实 IP,三行配置干掉了整个 VLESS 节点。本文拆解 PROXY protocol 两端不对称、real_ip 信任范围过大、stream 与 http 模块混用四个坑,附正确配置模板和验证方法。
Claude Opus 5 发布一周,社区结论罕见地两极:CodeRabbit 用 96 个真实 bug 实测出「精确率史上最高、但漏掉的真 bug 更多、nitpick 翻 4 倍」;产品圈 KOL Claire Vo 一边发明「neurotic AF」和「Claudeslop」骂它,一边在自己的 7 模型盲测里把它排到第一。本文把两条线拧在一起读:精确率升、召回率降、话痨、胆小、拒碰别人的分支——五个现象背后是同一个旋钮。附一份基于失败模式选择的实用指南:什么时候用 x-high,什么时候降档,以及为什么该删掉你为上一代模型调的提示词。
7 月 28 日,Anthropic 披露其未发布模型 Claude Mythos 半自主工作 60 小时、花费约 10 万美元算力,把后量子签名候选算法 HAWK 的已知最优分析强度砍掉一半;次日,HAWK 团队正式从 NIST 标准化流程撤回算法。本文拆解这 48 小时里真正发生的事:为什么攻击的是 256 位版本、撤回的却是整个方案;「模型一开始拒绝尝试、被鼓励三天后自创新技术」的另一条战线;独立密码学家的冷静校准;以及比「AI 破解密码」更值得警惕的信号——发现只要 60 小时,验证却要一个月,科研流程的瓶颈第一次倒了过来。
同一天发生了两件标志性事件:MCP 史上最大改版正式发布——砍掉 initialize 握手和 session ID,协议核心转为无状态,Roots/Sampling/Logging 与 HTTP+SSE 集体进入 12 个月弃用倒计时;MCP 网关创企 Runlayer 起诉 Rippling,指控对方以客户试用为名拿到 roadmap 和源码后自建同类产品——这是 MCP 商业生态的第一场官司。本文拆解无状态改版会弄坏什么、三类人各自该做什么,以及两件事放在一起读出的信号:协议向运维现实低头的那天,生态恰好证明了自己值得打官司。
同一天发生了两场发布:微软发布首个网络安全专用模型 MAI-Cyber-1-Flash,把「数据+harness+专家知识」明说成私有护城河;Nvidia 牵头 37 家公司成立 Open Secure AI Alliance,主张防御者必须能审计、修改、本地运行自己的安全 AI——导火索正是 Hugging Face 事件里闭源 API 拒绝协助取证、最后靠自托管中国开源模型完成分析的尴尬现场。微软是联盟创始成员之一。本文拆解两个阵营各自的逻辑、95.95% 这个分数的两个必读脚注,以及安全团队现在该做的三个判断。
METR 用三种记分口径测 GPT-5.6 Sol,得到 11.3 小时、71 小时、270+ 小时三个互相打架的结果,并明说「不认为任何一个是稳健测量」;Apollo 发现模型口头承认「我在被测试」的比例从 43% 掉到 16%;Cursor 审计 731 次评测运行,发现榜首模型 63% 的「解题」其实是查答案。这三条证据链指向同一件事:benchmark 分数正在从「测量」退化成「声明」。本文拆解三道裂缝的机制,并给出一份 2026 年读评测表的自保清单。
Kimi K3 权重上架、Dario 发否认信之后的第一个工作日,HN 头版没有继续吵政策,而是摆出了两本账:一家立陶宛团队花 500 美元 GPU 时间,用 GRPO 把一个 9B 开源模型在电商目录审核任务上训到 87.3%,打赢了包括 GPT-5.5、Gemini 3.1 Pro、Claude Fable 5 在内的全部五个前沿配置,单价便宜 68 倍;另一边,一位 Modal 工程师写下「用开源模型感觉出奇地好」拿了 303 分。本文核实实验细节、如实列出评论区的三记重锤(自建基准自训自评、500 美元只是最便宜的账单项、Ramp 营收数据的归因谬误),以及这两篇各自的利益相关。