工具大全
开发者工具作者:Coocon2026年8月23日129 次阅读约 15 分钟阅读

Fable 5 登顶 nanoGPT Speedrun:153 次自主实验、18 个模型,谁在真正逼近人类记录?

Fable 5 登顶 nanoGPT Speedrun:153 次自主实验、18 个模型,谁在真正逼近人类记录?

8 月 22 日,Prime Intellect 发布了 nanoGPT Speedrun Frontier 榜单——让 18 个前沿模型各自开着 coding agent 去优化 nanoGPT 的训练,看谁能在 24 小时预算内把验证损失压到最低。

结论有点反直觉:冲在最前面的不是 OpenAI,不是 Anthropic,而是一个叫 Fable 5 的模型,把人类纪录的差距抹掉了 81.7%。

"We ran 153 autonomous runs across 18 frontier models on the nanoGPT optimizer speedrun."

这是原文。下面的数字都是照着它一个个对过的。

这个榜单到底在测什么

nanoGPT Speedrun 不是测模型写代码快不快,而是测自主研究能力:给 agent 一个 nanoGPT 优化任务,让它自己读代码、改超参数、跑实验、迭代,在限定资源内逼近人类专家 2,600 步的纪录。

Prime Intellect 的做法是每个模型跑多次(总计 153 次),取最佳验证结果。模型背后挂什么 harness 也一起公开——claude-code、codex、kimi-code、qwen-code,全是各家自己的 coding agent。

这不是传统 benchmark。它测的是「把模型扔进一个开放式优化问题里,它能自己走多远」。

榜单解读:差距比想象中大

排名 模型 最佳纪录 追平人类差距 harness
1 Fable 5 2,726 81.7% claude-code · high
2 Opus 5 2,920 53.6% claude-code · max
3 Kimi K3 2,930 52.2% prime-agent · max
4 Kimi K3 2,974 45.8% kimi-code · max
5 Opus 4.8 3,018 39.4% claude-code · max
6 GPT-5.6 Sol 3,042 35.9% codex · xhigh
... DeepSeek V4 Pro 3,205 12.3% claude-code · max

有几个点挺有意思:

  • 第一名和第二名之间差了 28 个百分点。Fable 5(2,726)到 Opus 5(2,920),中间隔着 194 步——这个差距比榜单尾部好几名之间的距离都大。
  • 同一模型换 harness 成绩会变。Kimi K3 用 prime-agent 跑 2,930,换 kimi-code 掉到 2,974。agent 框架本身就能造成 1-2 名次的变化。
  • DeepSeek V4 Pro 排 13,追平 12.3%,但它只用了 1.1 天、309 次调用——榜单上最省资源的选手之一。资源效率是另一个维度。
  • 人类纪录 2,600 步,基线(不优化)3,290 步。连第一名都还没摸到人类水平,只走完 81.7% 的路。

一个类比:这像赛车,不只是比发动机

把模型比作发动机,harness 就是变速箱和悬挂。同一台发动机装不同的变速箱,圈速差很多。Fable 5 跑得快,一部分是发动机好,一部分是 claude-code 这个「变速箱」调得好——它用了 800M 总 token、811 次实验,是整个榜单上最肯「烧钱试错」的。

但反过来说:烧得多不等于跑得好。GPT-5.6 Sol 烧了 2.9B token、28k 次调用,结果只排第六。DeepSeek V4 Pro 用 26M token 就拿到了 12.3%——性价比差了两个数量级。

反对观点:跑分真能代表自主研究能力吗?

肯定有人要说:nanoGPT 优化是个收敛的、有明确目标的工程问题,跟开放式科学发现不是一回事。会调超参数不等于会做研究。这话没毛病——这个榜单测的是「工程型自主性」,不是「好奇心驱动的研究」。

但它的意义在于:这是第一次有机构用统一协议、统一预算、全公开 trace 的方式对比各家的 agent 化模型。之前各家 benchmark 各说各话,现在至少有了一个可以复现的参照系。Prime Intellect 还开放了 41 条完整 agent 轨迹(工具调用、subagent、scratchpad 全公开),你可以自己去翻 Fable 5 到底干了什么。

你今天可以做的事

  1. 去 https://www.primeintellect.ai/research/nanogpt-speedrun 翻 open traces,看 Fable 5 的 811 次实验里哪些策略有效。
  2. 如果你的团队在用 coding agent,留意 harness 选择——榜单显示同一模型换 agent 框架能差 2 个名次。
  3. 关注「资源效率」而不是只看绝对分:DeepSeek V4 Pro 证明低预算也能跑出有效结果。

FAQ

Q: nanoGPT Speedrun Frontier 是什么时候发布的? A: 2026 年 8 月 22 日,Prime Intellect 发布,属于其 NanoGPT Speedrun 系列的最新榜单。

Q: 第一名 Fable 5 是什么来头? A: 一个在榜单上以 2,726 步最佳纪录登顶的模型,用 claude-code · high harness 跑出 81.7% 的人类差距追平率,共 811 次实验、800M 总 token。

Q: 这个成绩意味着 agent 超过人类了吗? A: 没有。人类纪录是 2,600 步,Fable 5 的 2,726 步还差 126 步,第一名也只走完了 81.7% 的路。榜单尾部模型(如 Kimi K2.7、GPT-5.5)仅追平 7-8%。

✨ 本文由 DeepSeek 生成初稿,Claude 审核润色。

参考来源:

相关文章

码农早餐 · 2026-10-07

今日头菜:同样 $200 的 Claude 计划,值多少取决于你跑什么模型。另有 4 条快讯:vibe coding 不如手写代码爽:一篇 HN 热帖把「乐趣前置」说透了;Mistral Large 4 开放预览:1T 参数、49B 激活,权重月底才放;等。

daily-intel2026年10月7日11 min
30

码农早餐 · 2026-10-06

今日头菜:维基百科查了 OpenAI 的 Agent:改配置、探漏洞、爬走几百万页。另有 2 条快讯:Opus 5.5 找到两种室温磁性半导体,但有一种合成不出来;Beam 开源 501B 权重:23B 激活,但权重还没放出来。

daily-intel2026年10月6日9 min
58

码农早餐 · 2026-10-05

今日头菜:macOS 27 砍掉 Apple Intelligence 总开关:一个脚本帮你把模型请出去。另有 2 条快讯:125B 模型跑在 12G 显卡上:官方表里最快 94 tokens/s;pstack 移植到 6 个编码 Agent:Cursor 那套工作流被搬了出来。

daily-intel2026年10月5日7 min
78

LM Studio 速度慢怎么办:Mac 实测首字等 39 秒的真正原因是 prompt 预填充,不是 GPU 没开满

在 24GB M4 Mac mini 上用 LM Studio 跑 gemma-4-e4b(Q4_K_M)实测:生成速度约 29.5 tok/s,GPU offload 从全开调到全关只慢 11%;真正让人觉得慢的是长 prompt 的预填充——1.3 万 token 的 prompt 要等 39.4 秒才出第一个字(约 330 token/s),全 CPU 时还要再慢 3.4~3.7 倍。相同前缀的第二次请求首字只要 0.1 秒(前缀缓存)。--parallel 4 时同时来 4 个请求,每个只剩 9.7 tok/s。

mac-mini本地大模型+5
pitfalls2026年10月5日7 min
54