工具大全
开发者工具作者:Coocon2026年8月23日5 次阅读约 15 分钟阅读

Fable 5 登顶 nanoGPT Speedrun:153 次自主实验、18 个模型,谁在真正逼近人类记录?

Fable 5 登顶 nanoGPT Speedrun:153 次自主实验、18 个模型,谁在真正逼近人类记录?

8 月 22 日,Prime Intellect 发布了 nanoGPT Speedrun Frontier 榜单——让 18 个前沿模型各自开着 coding agent 去优化 nanoGPT 的训练,看谁能在 24 小时预算内把验证损失压到最低。

结论有点反直觉:冲在最前面的不是 OpenAI,不是 Anthropic,而是一个叫 Fable 5 的模型,把人类纪录的差距抹掉了 81.7%。

"We ran 153 autonomous runs across 18 frontier models on the nanoGPT optimizer speedrun."

这是原文。下面的数字都是照着它一个个对过的。

这个榜单到底在测什么

nanoGPT Speedrun 不是测模型写代码快不快,而是测自主研究能力:给 agent 一个 nanoGPT 优化任务,让它自己读代码、改超参数、跑实验、迭代,在限定资源内逼近人类专家 2,600 步的纪录。

Prime Intellect 的做法是每个模型跑多次(总计 153 次),取最佳验证结果。模型背后挂什么 harness 也一起公开——claude-code、codex、kimi-code、qwen-code,全是各家自己的 coding agent。

这不是传统 benchmark。它测的是「把模型扔进一个开放式优化问题里,它能自己走多远」。

榜单解读:差距比想象中大

排名 模型 最佳纪录 追平人类差距 harness
1 Fable 5 2,726 81.7% claude-code · high
2 Opus 5 2,920 53.6% claude-code · max
3 Kimi K3 2,930 52.2% prime-agent · max
4 Kimi K3 2,974 45.8% kimi-code · max
5 Opus 4.8 3,018 39.4% claude-code · max
6 GPT-5.6 Sol 3,042 35.9% codex · xhigh
... DeepSeek V4 Pro 3,205 12.3% claude-code · max

有几个点挺有意思:

  • 第一名和第二名之间差了 28 个百分点。Fable 5(2,726)到 Opus 5(2,920),中间隔着 194 步——这个差距比榜单尾部好几名之间的距离都大。
  • 同一模型换 harness 成绩会变。Kimi K3 用 prime-agent 跑 2,930,换 kimi-code 掉到 2,974。agent 框架本身就能造成 1-2 名次的变化。
  • DeepSeek V4 Pro 排 13,追平 12.3%,但它只用了 1.1 天、309 次调用——榜单上最省资源的选手之一。资源效率是另一个维度。
  • 人类纪录 2,600 步,基线(不优化)3,290 步。连第一名都还没摸到人类水平,只走完 81.7% 的路。

一个类比:这像赛车,不只是比发动机

把模型比作发动机,harness 就是变速箱和悬挂。同一台发动机装不同的变速箱,圈速差很多。Fable 5 跑得快,一部分是发动机好,一部分是 claude-code 这个「变速箱」调得好——它用了 800M 总 token、811 次实验,是整个榜单上最肯「烧钱试错」的。

但反过来说:烧得多不等于跑得好。GPT-5.6 Sol 烧了 2.9B token、28k 次调用,结果只排第六。DeepSeek V4 Pro 用 26M token 就拿到了 12.3%——性价比差了两个数量级。

反对观点:跑分真能代表自主研究能力吗?

肯定有人要说:nanoGPT 优化是个收敛的、有明确目标的工程问题,跟开放式科学发现不是一回事。会调超参数不等于会做研究。这话没毛病——这个榜单测的是「工程型自主性」,不是「好奇心驱动的研究」。

但它的意义在于:这是第一次有机构用统一协议、统一预算、全公开 trace 的方式对比各家的 agent 化模型。之前各家 benchmark 各说各话,现在至少有了一个可以复现的参照系。Prime Intellect 还开放了 41 条完整 agent 轨迹(工具调用、subagent、scratchpad 全公开),你可以自己去翻 Fable 5 到底干了什么。

你今天可以做的事

  1. https://www.primeintellect.ai/research/nanogpt-speedrun 翻 open traces,看 Fable 5 的 811 次实验里哪些策略有效。
  2. 如果你的团队在用 coding agent,留意 harness 选择——榜单显示同一模型换 agent 框架能差 2 个名次。
  3. 关注「资源效率」而不是只看绝对分:DeepSeek V4 Pro 证明低预算也能跑出有效结果。

FAQ

Q: nanoGPT Speedrun Frontier 是什么时候发布的? A: 2026 年 8 月 22 日,Prime Intellect 发布,属于其 NanoGPT Speedrun 系列的最新榜单。

Q: 第一名 Fable 5 是什么来头? A: 一个在榜单上以 2,726 步最佳纪录登顶的模型,用 claude-code · high harness 跑出 81.7% 的人类差距追平率,共 811 次实验、800M 总 token。

Q: 这个成绩意味着 agent 超过人类了吗? A: 没有。人类纪录是 2,600 步,Fable 5 的 2,726 步还差 126 步,第一名也只走完了 81.7% 的路。榜单尾部模型(如 Kimi K2.7、GPT-5.5)仅追平 7-8%。

✨ 本文由 DeepSeek 生成初稿,Claude 审核润色。

参考来源:

相关文章

MCP 官方发布新路线图:Agent 身份、DPoP、流式 HTTP 统一,五个优先方向定了

MCP 官方 8 月 22 日发布新路线图:Agentic 消息原语、HTTP 原生传输统一、Agent 身份与企业安全(DPoP + Workload Identity Federation)、原语改进、SDK 体验五大方向。对开发者意味着什么,一文说清。

developer2026年8月23日16 min
5

一个 4 个月的业余项目,把 Rust LSP 的内存砍掉两个数量级

一个开发者花 4 个月从零写了 Rust Glancer,把语言服务器内存压到 100MB 以下——比 rust-analyzer 省两个数量级,还获得 matklad 本人的背书。拆解「冻结分析 + 按需加载」的架构取舍、rowan 的 1% 与 99% 之争,以及谁才该换。

developer2026年8月23日11 min
24

码农早餐 · 2026-08-23

今日头菜:内存少两个数量级的 Rust LSP,Glancer 让 8GB 老机器也能写 Rust。另有 6 条快讯:Claude Code 被指悄悄 A/B 测试降低努力等级;MCP 官方发布新路线图,五大优先方向定下协议演进节奏;等。

daily-intel2026年8月23日8 min
52

24G Mac mini 跑 Qwen3.8-27B + DFlash 2:实测 1.8x,以及为什么到不了官方的 3x

DFlash 2 发布一周后,我在一台 24G 的 Mac mini M4 上把 Qwen3.8-27B 加投机解码完整跑通:4-bit 量化下从 6.5 tok/s 提到 11.7–12.2 tok/s,稳定 1.8–1.9 倍。这篇记录完整部署命令、三轮对照实测数据、24GB 的内存账,以及官方 2.7–3.4x 数字在消费级 Mac 上打折的三个具体原因。

qwendflash+6
ai-tutorials2026年8月23日5 min
41