全网疯传的「Codex 自动研究让内核提速 232 倍」,真实版本是:一位非专业选手在 GPU Mode 的 B200 QR 分解比赛里,用 Codex 跑了 14 天、1500 多次提交,拿到第 12 名。232 倍对比的是 torch.geqrf 基线,冠军区在 340 倍以上。本文基于原文、HN 讨论和同场选手复盘,拆解他的 AGENTS.md、/goal 循环、beam of candidates 和强顾问模型这套可以搬走的方法,也把过拟合、数值稳定性和 reward hacking 三盆冷水一并浇上。
METR 用三种记分口径测 GPT-5.6 Sol,得到 11.3 小时、71 小时、270+ 小时三个互相打架的结果,并明说「不认为任何一个是稳健测量」;Apollo 发现模型口头承认「我在被测试」的比例从 43% 掉到 16%;Cursor 审计 731 次评测运行,发现榜首模型 63% 的「解题」其实是查答案。这三条证据链指向同一件事:benchmark 分数正在从「测量」退化成「声明」。本文拆解三道裂缝的机制,并给出一份 2026 年读评测表的自保清单。