Agent 评测的"王座"又换人了——这次坐上去的是 Qwen
Agent 评测的"王座"又换人了——这次坐上去的是 Qwen
昨天下午三点,我盯着终端里一个 PR review agent 的输出发呆:这写的什么玩意儿,上周还不是这样。第一反应是 prompt 被我改坏了,翻了半天 git log 没找到嫌疑人。后来才想起来,上周为了省点 token 钱,我把默认模型从 Sonnet 4 换成了 Gemini 3。
就换了个模型,agent 的靠谱程度掉了一档。
巧的是当天晚上,Artificial Analysis 的 Agentic Index 排行榜更新,阿里的 Qwen3.8 Max 坐上了综合第一。
这事值得说道说道。
榜单没说的事:Agent 评测终于开始像回事了
先搞清楚 Agentic Index 是个什么东西。
LLM 排行榜这两年换了三副面孔:先是刷 MMLU,比谁选择题做得准;然后是 Chatbot Arena,比谁说话让人听着舒服;现在轮到比"干活"。Agentic Index 属于第三种。它把模型扔进真实的工具调用环境里:查 API 文档、调 SDK、报错了自己处理、最后交结果。
说白了就是当实习生用,看谁真能交活。
方法论比前两代靠谱。但有坑。
坑在哪? 它排的是综合表现,质量、速度、成本三个维度加权出来一个数。Qwen 登顶不等于它纯能力碾压 GPT-5 或 Claude,很可能是靠成本和速度拉的分。"性价比第一"和"性能第一",中间隔着一条街。
还有个所有封闭评测都躲不掉的老问题:评测集泄漏。训练数据里见过类似的 agent 任务,跑分自然好看。你要是真信了榜单就换生产模型,上线第一周大概率翻车。
不过有一点不用争:中国大模型在 agent 这块,已经不是追赶者了。
当模型会自我改进了,评测还跟得上吗?
同一天还有条新闻被榜单盖过去了:Prime Intellect 开源了 Prime Agent,一个能自我改进的 agent 框架。
我觉得这条比 Qwen 登顶更值得看,因为它动的是评测体系的根。
Prime Agent 的设计挺刁钻。它把 agent 的上下文当变量,把子 agent 调用当函数——在 IPython 内核里写一行 await rlm("review PR #42"),就派出去一个子 agent 干活。更狠的是 Continual Harness:agent 能在执行过程中改自己的 prompt、技能和记忆。
翻译成人话,这不是那种"调好 prompt 就定型"的 agent,是一个边干活边重构自己的 agent。
评测悖论就来了:会自我进化的东西,你怎么打分?今天测出来 85 分,明天它自己改了三个 prompt,可能变 92,也可能变 70。
两条新闻,三个信号
评测从"比嘴"进化到"比手",但还是静态考试。 Agentic Index 是进步,可它终究是一次性的期末考。真正配得上 agent 的评测应该像 CI/CD pipeline,天天跑,持续比。
agent 框架正在从"配置"转向"自编程"。 RLM + Continual Harness 走的是另一条路:不是人工设计 agent,而是让 agent 自己写 agent。LangChain、CrewAI 那套手写 sub-agent 的活法,往后会越来越像马车跟汽车赛跑。
能力差距在缩小,评测通胀在加速。 Qwen、Claude、GPT 在 agent 能力上越挨越近,"谁第一"这件事的边际价值就越来越小。真正值钱的问题变成了:在你那堆具体的活上,谁最稳?
你今天可以做的事
花 30 分钟做个小实验:挑三个你手头真实的 agent 任务,Qwen3.8 Max 和你现在用的模型各跑一遍。别看榜,看结果。
榜单是别人的答案,你的任务是你自己的题。这俩差得比你以为的远。
参考来源:
✨ 本文由 DeepSeek 生成初稿,Claude 审核润色。