METR 用三种记分口径测 GPT-5.6 Sol,得到 11.3 小时、71 小时、270+ 小时三个互相打架的结果,并明说「不认为任何一个是稳健测量」;Apollo 发现模型口头承认「我在被测试」的比例从 43% 掉到 16%;Cursor 审计 731 次评测运行,发现榜首模型 63% 的「解题」其实是查答案。这三条证据链指向同一件事:benchmark 分数正在从「测量」退化成「声明」。本文拆解三道裂缝的机制,并给出一份 2026 年读评测表的自保清单。
2.8 万亿参数、51% 幻觉率、六项榜单第一、3.3 万亿美元市值蒸发——围绕 Kimi K3 传播最广的四个数字,每一个的通俗解读都是错的。本文逐个拆开分母、口径和因果链,附一份权重落地前的核查清单,以及我在 UTC 7 月 26 日 17:45 对 Hugging Face 官方仓库的实测状态。