工具大全
开发者工具2026年8月7日6 次阅读约 10 分钟阅读

Agent 评测的"王座"又换人了——这次坐上去的是 Qwen

Agent 评测的"王座"又换人了——这次坐上去的是 Qwen

昨天下午三点,我盯着终端里一个 PR review agent 的输出发呆:这写的什么玩意儿,上周还不是这样。第一反应是 prompt 被我改坏了,翻了半天 git log 没找到嫌疑人。后来才想起来,上周为了省点 token 钱,我把默认模型从 Sonnet 4 换成了 Gemini 3。

就换了个模型,agent 的靠谱程度掉了一档。

巧的是当天晚上,Artificial Analysis 的 Agentic Index 排行榜更新,阿里的 Qwen3.8 Max 坐上了综合第一。

这事值得说道说道。

榜单没说的事:Agent 评测终于开始像回事了

先搞清楚 Agentic Index 是个什么东西。

LLM 排行榜这两年换了三副面孔:先是刷 MMLU,比谁选择题做得准;然后是 Chatbot Arena,比谁说话让人听着舒服;现在轮到比"干活"。Agentic Index 属于第三种。它把模型扔进真实的工具调用环境里:查 API 文档、调 SDK、报错了自己处理、最后交结果。

说白了就是当实习生用,看谁真能交活。

方法论比前两代靠谱。但有坑。

坑在哪? 它排的是综合表现,质量、速度、成本三个维度加权出来一个数。Qwen 登顶不等于它纯能力碾压 GPT-5 或 Claude,很可能是靠成本和速度拉的分。"性价比第一"和"性能第一",中间隔着一条街。

还有个所有封闭评测都躲不掉的老问题:评测集泄漏。训练数据里见过类似的 agent 任务,跑分自然好看。你要是真信了榜单就换生产模型,上线第一周大概率翻车。

不过有一点不用争:中国大模型在 agent 这块,已经不是追赶者了。

当模型会自我改进了,评测还跟得上吗?

同一天还有条新闻被榜单盖过去了:Prime Intellect 开源了 Prime Agent,一个能自我改进的 agent 框架。

我觉得这条比 Qwen 登顶更值得看,因为它动的是评测体系的根。

Prime Agent 的设计挺刁钻。它把 agent 的上下文当变量,把子 agent 调用当函数——在 IPython 内核里写一行 await rlm("review PR #42"),就派出去一个子 agent 干活。更狠的是 Continual Harness:agent 能在执行过程中改自己的 prompt、技能和记忆。

翻译成人话,这不是那种"调好 prompt 就定型"的 agent,是一个边干活边重构自己的 agent。

评测悖论就来了:会自我进化的东西,你怎么打分?今天测出来 85 分,明天它自己改了三个 prompt,可能变 92,也可能变 70。

两条新闻,三个信号

评测从"比嘴"进化到"比手",但还是静态考试。 Agentic Index 是进步,可它终究是一次性的期末考。真正配得上 agent 的评测应该像 CI/CD pipeline,天天跑,持续比。

agent 框架正在从"配置"转向"自编程"。 RLM + Continual Harness 走的是另一条路:不是人工设计 agent,而是让 agent 自己写 agent。LangChain、CrewAI 那套手写 sub-agent 的活法,往后会越来越像马车跟汽车赛跑。

能力差距在缩小,评测通胀在加速。 Qwen、Claude、GPT 在 agent 能力上越挨越近,"谁第一"这件事的边际价值就越来越小。真正值钱的问题变成了:在你那堆具体的活上,谁最稳?

你今天可以做的事

花 30 分钟做个小实验:挑三个你手头真实的 agent 任务,Qwen3.8 Max 和你现在用的模型各跑一遍。别看榜,看结果。

榜单是别人的答案,你的任务是你自己的题。这俩差得比你以为的远。


参考来源:

✨ 本文由 DeepSeek 生成初稿,Claude 审核润色。

相关文章

码农早餐 · 2026-08-07

今日精选 8 条 AI 圈情报:《超级马里奥》遇上帕累托最优:游戏机制与经济学原理的跨界解读;Crime Pays but Botany Doesn't 网站阅读列表;《银翼杀手》标题卡设计赏析;等...

daily-intel2026年8月7日8 min
7

claude install 断链、%h 未展开?Debian 容器实测装出来是好的(未复现)

GitHub 上有 Fedora 用户报告:官方一键安装脚本装完后 ~/.local/bin/claude 是条断链,指向字面量 %h/.local/share/claude/versions/2.1.220——%h 这个占位符没被展开成家目录。我们在干净的 Debian 12 容器里按原报告的完整命令实测,装出来的符号链接是正常的(%h 已正确展开),且当前 install.sh 分发的版本已是 2.1.223(报告版本为 2.1.220)。本文是一篇「未复现实录」:完整给出实测环境、命令与输出证据,分析未复现的三种可能解释,并附上如果你正被断链卡住的一分钟手工修复。

claude-codeclaude-code-lab+4
claude2026年8月7日2 min
9

Claude Code 报 No conversation found to continue:你的 -p 会话被交互模式过滤掉了

用 claude -p 跑完一条无头命令,接着敲 claude --continue 想进交互模式续聊,得到的却是 No conversation found to continue——但会话文件明明就在磁盘上。这是 v2.1.90 引入的回归:--resume 选择器'不展示 -p/SDK 会话'的过滤逻辑,误伤了本应无条件继续最近会话的 --continue。本文在 macOS + v2.1.220 上完整复现(GitHub issue 报告的是 Fedora,两平台坐实),给出两条实测可用的绕行:无头续聊 -p --continue 一直是通的;交互模式用 CLAUDE_CODE_ENTRYPOINT=sdk-cli 前缀可以绕过过滤、完整加载历史。

claude-codeheadless+4
claude2026年8月6日2 min
23

Claude Code 到底在用哪个模型?settings.json、环境变量、--model 的优先级实测

多智能体、CI、批量脚本都依赖一个前提:会话真的跑在你配置的模型上。但模型可以在四个地方指定——settings.json、ANTHROPIC_MODEL 环境变量、--model 参数、会话内 /model——文档没有一张表告诉你谁覆盖谁,GitHub 上还有 Windows 用户报告 settings.json 配置被静默忽略、一整天的任务跑错模型全部作废。本文用 modelUsage 铁证逐层实测出优先级链:--model > ANTHROPIC_MODEL > 项目 settings.json > 内置默认,[1m] 后缀写法同样生效;并给出一个比任何 UI 提示都可靠的验证手段。

claude-codeclaude-code-lab+4
claude2026年8月6日3 min
22