工具大全
AI 教程作者:Coocon2026年8月18日27 次阅读约 4 分钟阅读

Qwen3.8 27B:本地模型新标杆,但请先关掉默认推理档

Qwen3.8 27B:本地模型新标杆,但请先关掉默认推理档

同一个模型,同一周里收获了两种截然相反的头条。

一边是 Artificial Analysis 的独立评测:Intelligence Index 52 分——上一代 Qwen3.6 27B 只有 38 分,一代跳了 14 分,一个 27B 的 dense 模型追到了旗舰 MoE 的门口(Qwen3.8-Max 也才 58 分)。

另一边是 Simon Willison 8 月 16 日的实测博客,标题毫不客气:《Qwen 3.8 27B is excellent, but it defaults to wildly overthinking things》——很强,但默认设置「疯狂过度思考」。

这两件事都是真的,而且互为注脚。Hacker News 上三波讨论合计超过 2400 分(发布帖 1423 分、Simon 文 751 分、AA 评分帖 305 分),这大概是今年本地模型圈最热闹的一周。


先把模型本身说清楚

Qwen3.8 27B 由阿里通义实验室于 8 月 14 日发布:27.78B 参数、dense 架构(不是 MoE)、多模态输入(文本/图像/视频)、原生 262,144 token 上下文(YaRN 可扩到 1M)、Apache 2.0 协议。对本地玩家最关键的一个数字:Q4_K_M 量化后只有 17GB,一台 24GB 显存的机器或大内存 Mac 就能跑。

官方自报的基准很凶:SWE-Bench Pro 61.7%、LiveCodeBench 90.3%、GPQA Diamond 89.2%。照例提醒:这些是厂商自报数字,部分跑在内部修改版基准上,目前没有独立复现——真正有第三方背书的是上面那个 AA 52 分。

21 分钟 vs 137 秒:过度思考长什么样

Simon 的测试环境是 128GB 的 M5 Max MacBook Pro 和一台 NVIDIA DGX Spark。问题出在模型的默认推理档位:reasoning_effort 出厂默认 xhigh

后果是什么?他的招牌测试「画一只骑自行车的鹈鹕 SVG」,默认档跑了 21 分钟,烧掉 22,276 个 reasoning token;关掉推理之后,同样的任务 137 秒出结果。更荒诞的一个例子:让它「画一个圆的 SVG」,它自己脑补出了一套包豪斯风格的动画圆环设计研究——Simon 的原话是 "absolutely beautiful... which was entirely not what I had asked for!"(美极了……但完全不是我要的东西)。

他对默认设置的评价:"This is a hilarious default. It's absolutely not a good way to run the model, especially on consumer hardware."(这个默认值很搞笑,绝对不是运行这个模型的正确方式,尤其在消费级硬件上。)

有意思的是,Artificial Analysis 的数据独立佐证了「话痨」这个判断:跑完整个 Intelligence Index,Qwen3.8 27B 生成了 1.6 亿个 token,而全部上榜模型的中位数是 4300 万——接近 4 倍于中位数的输出量。过度思考不是 Simon 的体感,是有账单的。

但推理也不是废物

在把默认档骂完之后,Simon 补了一个反例:他让模型给图片做 bounding box 标注并生成标注工具,关闭推理时结果「几乎能用,但框的位置是错的」;开启推理后就对了。他的原话:"this is a good example of how reasoning can make a difference"。

所以正确的结论不是「推理无用」,而是推理深度应该按任务分配,而这个模型把最贵的档位设成了出厂默认

实操:三档怎么调,速度怎么救

推理档位reasoning_effort 有三档:xhigh(默认)/ medium / low,也可以完全关闭 reasoning。Simon 的明确建议:"My strong recommendation: ignore that default. Run Qwen 3.8 27B on low or even no reasoning levels at first."(强烈建议无视默认值,先用 low 甚至无推理档跑。)日常问答、代码补全、格式转换用 low/off;确实需要多步推理的任务(复杂调试、空间理解类)再升 medium/xhigh。

速度。dense 架构吃内存带宽,这是它在本地跑不快的结构性原因——LM Studio 下 Simon 实测只有 15-30 token/s,他坦言「感觉慢……要把我从托管 API 模型那里赢回来还很难」。但有个额外的翻盘点:模型内建了 Multi-Token Prediction(MTP),llama.cpp 用 --spec-type draft-mtp 开启后,Simon 在 DGX Spark 上实测提速约 72%(方法来自 Georgi Gerganov 的推文)。用 llama.cpp/llama-server 的用户别漏掉这个开关。

为什么这个模型重要

Simon 给这个模型的总评有两句值得抄下来。

第一句关于现在:"The fact that a 17GB file can do all of this stuff on my home machines is a miracle."(一个 17GB 的文件能在我家里的机器上干出这一切,是个奇迹。)他还确认这是「迄今为止本地模型画出的最好的鹈鹕」,视觉 bounding box 的精度「好得惊人」,还能驱动 Pi coding agent 读 Datasette 源码并写出可用工具。

第二句关于趋势:"The most important thing about Qwen 3.8 27B is what it demonstrates."(这个模型最重要的,是它证明了什么。)一年前这个水平的能力还需要几百 GB 的旗舰模型;现在它被压进了 17GB、Apache 2.0、任何人都能下载的文件里。dense 追平 MoE、本地追赶云端的速度,比任何一家厂商的路线图都快。

只是记得:下载完之后,第一件事是把 reasoning_effort 调低。好模型配错默认值,白白浪费你 21 分钟。


资料来源: Simon Willison:Qwen 3.8 27B is excellent, but it defaults to wildly overthinking things Artificial Analysis:Qwen3.8 27B 模型页 Qwen 官方:发布博客 / Hugging Face 模型卡 Hacker News:发布帖(1423 分) / Simon 评测帖(751 分) / AA 52 分帖(305 分)

相关文章

Stripe 70 亿收购 OpenRouter:买的是路由权

Stripe 敲定超 70 亿美元收购 OpenRouter,这笔钱买的不是转发请求的代码,而是决定海量推理请求流向哪家供应商的权力。但它买到了亚马逊的位置,没买到亚马逊的锁定。

llmai-infrastructure+3
ai-tutorials2026年8月17日13 min
177

Debian 正在投票决定 AI 代码的命运:8 个选项讲清,附各大开源社区政策对照表

2026 年 8 月 15 日至 28 日,Debian 开发者正在对「LLM 能不能用于 Debian 贡献」进行正式投票(GR 2026-002)。选票上有 8 个提案,从写进社会契约的全面禁止到不禁不倡,光谱完整;最严的选项需要 3:1 绝对多数。本文基于官方投票页、邮件列表原文和 LWN 报道,讲清 8 个选项的差别、两派核心论点、这场投票怎么走到今天,并附 Gentoo、Fedora、QEMU、curl、Linux 内核等十余个社区的 AI 贡献政策对照表。

llmdebian+6
developer2026年8月16日8 min
141

Claude 文本水印:藏在随机数里的签名

Anthropic 公开了 Claude 文本水印的完整技术细节:不加字、不加隐藏字符、不涨价,只是把选词时的随机数来源换成了「密钥 + 前文」。但它能证明的东西比大多数人以为的少得多——短文本查不出、代码几乎没有、帮你润色的那段基本查不到。

claudellm+5
ai-tutorials2026年8月16日10 min
39

Fable 5 明明是 1M 上下文,状态栏却显示 200k:别急着换工具,先抓一份现场数据

Claude Fable 5 官方确认 1M token 上下文窗口,但 Claude Code 底部状态栏的分母一直是 200k。第一反应是「换个更好的 statusline」——错了。本文复盘完整排障过程:用一行 tee 抓下 statusline 的 stdin 现场,实锤官方字段对新模型误报 200000,最后用一张模型表修正。附赠一个通用教训:换工具修不了数据源的错。

llmclaude-code+3
pitfalls2026年8月14日3 min
247