Kimi K3 权重上架、Dario 发否认信之后的第一个工作日,HN 头版没有继续吵政策,而是摆出了两本账:一家立陶宛团队花 500 美元 GPU 时间,用 GRPO 把一个 9B 开源模型在电商目录审核任务上训到 87.3%,打赢了包括 GPT-5.5、Gemini 3.1 Pro、Claude Fable 5 在内的全部五个前沿配置,单价便宜 68 倍;另一边,一位 Modal 工程师写下「用开源模型感觉出奇地好」拿了 303 分。本文核实实验细节、如实列出评论区的三记重锤(自建基准自训自评、500 美元只是最便宜的账单项、Ramp 营收数据的归因谬误),以及这两篇各自的利益相关。
7 月下旬,一篇《Why Software Factories Fail》冲上 Hacker News 390 分。作者 Dex Horthy 不是 AI 怀疑论者——他靠教人用 coding agent 出名,视频累计百万播放。2025 年 7 月他把自己公司改成『没人看代码』的关灯工厂,11 月第三次事故后,联合创始人在 VS Code 里手写了整整两周代码重建。本文拆解他给出的根因:强化学习的打分机制里,『破坏可维护性』没有任何惩罚——这不是使用技巧问题,是模型训练问题。