工具大全
开发者工具作者:Coocon2026年8月7日126 次阅读约 10 分钟阅读

Agent 评测的"王座"又换人了——这次坐上去的是 Qwen

Agent 评测的"王座"又换人了——这次坐上去的是 Qwen

昨天下午三点,我盯着终端里一个 PR review agent 的输出发呆:这写的什么玩意儿,上周还不是这样。第一反应是 prompt 被我改坏了,翻了半天 git log 没找到嫌疑人。后来才想起来,上周为了省点 token 钱,我把默认模型从 Sonnet 4 换成了 Gemini 3。

就换了个模型,agent 的靠谱程度掉了一档。

巧的是当天晚上,Artificial Analysis 的 Agentic Index 排行榜更新,阿里的 Qwen3.8 Max 坐上了综合第一。

这事值得说道说道。

榜单没说的事:Agent 评测终于开始像回事了

先搞清楚 Agentic Index 是个什么东西。

LLM 排行榜这两年换了三副面孔:先是刷 MMLU,比谁选择题做得准;然后是 Chatbot Arena,比谁说话让人听着舒服;现在轮到比"干活"。Agentic Index 属于第三种。它把模型扔进真实的工具调用环境里:查 API 文档、调 SDK、报错了自己处理、最后交结果。

说白了就是当实习生用,看谁真能交活。

方法论比前两代靠谱。但有坑。

坑在哪? 它排的是综合表现,质量、速度、成本三个维度加权出来一个数。Qwen 登顶不等于它纯能力碾压 GPT-5 或 Claude,很可能是靠成本和速度拉的分。"性价比第一"和"性能第一",中间隔着一条街。

还有个所有封闭评测都躲不掉的老问题:评测集泄漏。训练数据里见过类似的 agent 任务,跑分自然好看。你要是真信了榜单就换生产模型,上线第一周大概率翻车。

不过有一点不用争:中国大模型在 agent 这块,已经不是追赶者了。

当模型会自我改进了,评测还跟得上吗?

同一天还有条新闻被榜单盖过去了:Prime Intellect 开源了 Prime Agent,一个能自我改进的 agent 框架。

我觉得这条比 Qwen 登顶更值得看,因为它动的是评测体系的根。

Prime Agent 的设计挺刁钻。它把 agent 的上下文当变量,把子 agent 调用当函数——在 IPython 内核里写一行 await rlm("review PR #42"),就派出去一个子 agent 干活。更狠的是 Continual Harness:agent 能在执行过程中改自己的 prompt、技能和记忆。

翻译成人话,这不是那种"调好 prompt 就定型"的 agent,是一个边干活边重构自己的 agent。

评测悖论就来了:会自我进化的东西,你怎么打分?今天测出来 85 分,明天它自己改了三个 prompt,可能变 92,也可能变 70。

两条新闻,三个信号

评测从"比嘴"进化到"比手",但还是静态考试。 Agentic Index 是进步,可它终究是一次性的期末考。真正配得上 agent 的评测应该像 CI/CD pipeline,天天跑,持续比。

agent 框架正在从"配置"转向"自编程"。 RLM + Continual Harness 走的是另一条路:不是人工设计 agent,而是让 agent 自己写 agent。LangChain、CrewAI 那套手写 sub-agent 的活法,往后会越来越像马车跟汽车赛跑。

能力差距在缩小,评测通胀在加速。 Qwen、Claude、GPT 在 agent 能力上越挨越近,"谁第一"这件事的边际价值就越来越小。真正值钱的问题变成了:在你那堆具体的活上,谁最稳?

你今天可以做的事

花 30 分钟做个小实验:挑三个你手头真实的 agent 任务,Qwen3.8 Max 和你现在用的模型各跑一遍。别看榜,看结果。

榜单是别人的答案,你的任务是你自己的题。这俩差得比你以为的远。


参考来源:

✨ 本文由 DeepSeek 生成初稿,Claude 审核润色。

相关文章

码农早餐 · 2026-09-21

今日头菜:ChatGPT 的广告 Cookie 跨站追踪:936 个追踪像素、1029 个域名。另有 7 条快讯:AI Studio 删数据只删本地指针,举报者 60 秒被封号;Mac M4 离线跑 Laya:CoreML 每秒约 45 次决策;等。

daily-intel2026年9月21日13 min
13

DeepSeek 标称 1M、Claude Code 只认 200K:两个都测了,真正卡住你的是第三个数

DeepSeek 标称 1M 上下文,而 Claude Code 接上去之后对同一个模型报告 contextWindow 200000。我把两边都测了。DeepSeek 的真实上限是 1,048,576——字面的 2 的 20 次方,不是一百万整——而且这个额度**含**你的 max_tokens 输出预算,用一组对照实验坐实。针插在第 0 位、上下文 1,039,744 token 时仍被准确捞出。Claude Code 则在远低于此处就本地拒绝,25 毫秒、零 API 调用,而且它卡的**根本不是 token**:闸门在约 48 万字符。喂高熵文本,478,000 字符顺利通过、真实 token 高达 309,567——比它刚刚自称的 20 万窗口还多 55%。而日常使用里这三个数你一个都碰不到,因为 Bash 输出超过整 30,000 字符就压根不进上下文。

claude-code长上下文+5
hands-on2026年9月20日6 min
11

拿 DeepSeek 当 Claude Code 后端:功能全通,但成本显示虚高 38 倍

DeepSeek 提供 Anthropic 格式端点,三个环境变量就能让 Claude Code 转去调它。我在真机上把整条链跑了一遍:本地工具(Read / Write / Bash / Glob / Edit / 子代理)全部正常且副作用真实发生,所以结论是能用。但没人测过的那部分是——Claude Code 按 Claude Sonnet 的价目给 DeepSeek 的 token 计费。十次相同调用,Claude Code 报告花了 $1.71,DeepSeek 账户实际只扣了 ¥0.32(≈$0.045),虚高 38 倍,这是余额差不是价目表推算。另外:官方文档关于未知模型名的说法是错的(会 400 而不是回落),v4-pro 默认返回 thinking 块导致小 max_tokens 看起来是空响应,以及一个看着像 DeepSeek 的锅其实不是的失败。

claude-codedeepseek+5
hands-on2026年9月20日7 min
17

码农早餐 · 2026-09-20

今日头菜:Gemini 猜密码进了三家系统,测试跑出了边界。另有 7 条快讯:Stagehand 称 Playwright 提速 2 倍、token 省 80%;593 次跑测:多设备 CoW 文件系统在常规基准外的表现;等。

daily-intel2026年9月20日9 min
44