Fable 5 登顶 nanoGPT Speedrun:153 次自主实验、18 个模型,谁在真正逼近人类记录?
Fable 5 登顶 nanoGPT Speedrun:153 次自主实验、18 个模型,谁在真正逼近人类记录?
8 月 22 日,Prime Intellect 发布了 nanoGPT Speedrun Frontier 榜单——让 18 个前沿模型各自开着 coding agent 去优化 nanoGPT 的训练,看谁能在 24 小时预算内把验证损失压到最低。
结论有点反直觉:冲在最前面的不是 OpenAI,不是 Anthropic,而是一个叫 Fable 5 的模型,把人类纪录的差距抹掉了 81.7%。
"We ran 153 autonomous runs across 18 frontier models on the nanoGPT optimizer speedrun."
这是原文。下面的数字都是照着它一个个对过的。
这个榜单到底在测什么
nanoGPT Speedrun 不是测模型写代码快不快,而是测自主研究能力:给 agent 一个 nanoGPT 优化任务,让它自己读代码、改超参数、跑实验、迭代,在限定资源内逼近人类专家 2,600 步的纪录。
Prime Intellect 的做法是每个模型跑多次(总计 153 次),取最佳验证结果。模型背后挂什么 harness 也一起公开——claude-code、codex、kimi-code、qwen-code,全是各家自己的 coding agent。
这不是传统 benchmark。它测的是「把模型扔进一个开放式优化问题里,它能自己走多远」。
榜单解读:差距比想象中大
| 排名 | 模型 | 最佳纪录 | 追平人类差距 | harness |
|---|---|---|---|---|
| 1 | Fable 5 | 2,726 | 81.7% | claude-code · high |
| 2 | Opus 5 | 2,920 | 53.6% | claude-code · max |
| 3 | Kimi K3 | 2,930 | 52.2% | prime-agent · max |
| 4 | Kimi K3 | 2,974 | 45.8% | kimi-code · max |
| 5 | Opus 4.8 | 3,018 | 39.4% | claude-code · max |
| 6 | GPT-5.6 Sol | 3,042 | 35.9% | codex · xhigh |
| ... | DeepSeek V4 Pro | 3,205 | 12.3% | claude-code · max |
有几个点挺有意思:
- 第一名和第二名之间差了 28 个百分点。Fable 5(2,726)到 Opus 5(2,920),中间隔着 194 步——这个差距比榜单尾部好几名之间的距离都大。
- 同一模型换 harness 成绩会变。Kimi K3 用 prime-agent 跑 2,930,换 kimi-code 掉到 2,974。agent 框架本身就能造成 1-2 名次的变化。
- DeepSeek V4 Pro 排 13,追平 12.3%,但它只用了 1.1 天、309 次调用——榜单上最省资源的选手之一。资源效率是另一个维度。
- 人类纪录 2,600 步,基线(不优化)3,290 步。连第一名都还没摸到人类水平,只走完 81.7% 的路。
一个类比:这像赛车,不只是比发动机
把模型比作发动机,harness 就是变速箱和悬挂。同一台发动机装不同的变速箱,圈速差很多。Fable 5 跑得快,一部分是发动机好,一部分是 claude-code 这个「变速箱」调得好——它用了 800M 总 token、811 次实验,是整个榜单上最肯「烧钱试错」的。
但反过来说:烧得多不等于跑得好。GPT-5.6 Sol 烧了 2.9B token、28k 次调用,结果只排第六。DeepSeek V4 Pro 用 26M token 就拿到了 12.3%——性价比差了两个数量级。
反对观点:跑分真能代表自主研究能力吗?
肯定有人要说:nanoGPT 优化是个收敛的、有明确目标的工程问题,跟开放式科学发现不是一回事。会调超参数不等于会做研究。这话没毛病——这个榜单测的是「工程型自主性」,不是「好奇心驱动的研究」。
但它的意义在于:这是第一次有机构用统一协议、统一预算、全公开 trace 的方式对比各家的 agent 化模型。之前各家 benchmark 各说各话,现在至少有了一个可以复现的参照系。Prime Intellect 还开放了 41 条完整 agent 轨迹(工具调用、subagent、scratchpad 全公开),你可以自己去翻 Fable 5 到底干了什么。
你今天可以做的事
- 去 https://www.primeintellect.ai/research/nanogpt-speedrun 翻 open traces,看 Fable 5 的 811 次实验里哪些策略有效。
- 如果你的团队在用 coding agent,留意 harness 选择——榜单显示同一模型换 agent 框架能差 2 个名次。
- 关注「资源效率」而不是只看绝对分:DeepSeek V4 Pro 证明低预算也能跑出有效结果。
FAQ
Q: nanoGPT Speedrun Frontier 是什么时候发布的? A: 2026 年 8 月 22 日,Prime Intellect 发布,属于其 NanoGPT Speedrun 系列的最新榜单。
Q: 第一名 Fable 5 是什么来头? A: 一个在榜单上以 2,726 步最佳纪录登顶的模型,用 claude-code · high harness 跑出 81.7% 的人类差距追平率,共 811 次实验、800M 总 token。
Q: 这个成绩意味着 agent 超过人类了吗? A: 没有。人类纪录是 2,600 步,Fable 5 的 2,726 步还差 126 步,第一名也只走完了 81.7% 的路。榜单尾部模型(如 Kimi K2.7、GPT-5.5)仅追平 7-8%。
✨ 本文由 DeepSeek 生成初稿,Claude 审核润色。
参考来源:
- Prime Intellect: NanoGPT Speedrun Frontier