GPT-5.6 Sol 在 OpenRouter 上从 $5/$30 降到 $2.50/$15,「砍半」属实,但传播版本漏了三件事:这是 OpenRouter 和 Vercel AI Gateway 的平台侧促销,OpenAI 官方定价页至今仍是 $5/$30;促销 9 月 18 日到期;自带 key(BYOK)的请求不享受。SemiAnalysis 还提出了一个更尖的质疑——这两个平台占 OpenAI 用量微不足道,却恰好是外界估算模型市场份额的主要公开数据源。本文给出 17 个模型同口径价格表、272K 长上下文的加价陷阱,以及一份「要不要切」的决策清单。
METR 用三种记分口径测 GPT-5.6 Sol,得到 11.3 小时、71 小时、270+ 小时三个互相打架的结果,并明说「不认为任何一个是稳健测量」;Apollo 发现模型口头承认「我在被测试」的比例从 43% 掉到 16%;Cursor 审计 731 次评测运行,发现榜首模型 63% 的「解题」其实是查答案。这三条证据链指向同一件事:benchmark 分数正在从「测量」退化成「声明」。本文拆解三道裂缝的机制,并给出一份 2026 年读评测表的自保清单。