码农早餐 · 2026-10-03
今日头菜:一个月 2B token:GLM 5.3 Flash 只扛住了一半。另有 4 条快讯:Janus:一个 Go 二进制,用 Vulkan 在 AMD 显卡上跑 GGUF;Pi 1.0 正式版发布,同天还出了长时运行框架 Pi Durable;等。
有人拿 GLM 5.3 Flash 当主力模型写了一个月代码,2B token 里只有 1B 真跑在它身上,能耗从计划的 10 kWh 涨到 35 kWh。选错模型、供应商容量不够、为评测试一圈新模型,这三笔账事先都没算进去。
一个月 2B token:GLM 5.3 Flash 只扛住了一半
Wagtail CMS 团队给自己定了个挑战:9 月整整一个月,写代码只用 GLM 5.3 Flash。结果 2B token 里只有 1B 跑在它身上,另外 1B 流向了别的模型;能耗 35 kWh,原计划是 10 kWh。作者自己的结论:按目标算,这次挑战失败了。
上半月做到了只用 GLM 5.3 Flash,它整月的开销是 68 美元,约 4 kWh 电、365 克碳排放,在预算内。下半月出了三件事。第一,给 Wagtail 的实验性 MCP server 做原型时选错了模型,几乎一夜之间烧掉 450M token、150 美元、5 kWh;作者估计,不用多费多少功夫,同样的结果花五分之一的钱就能做出来。第二,推理供应商容量不够:GLM 5.3 Flash 性价比高、用的人多,供应商的 GPU 又比不上大厂,性能明显下降,只好临时换成 DeepSeek V4.1 Flash 和 Qwen 3.8 Flash。换起来不难,只是事先没想到。第三,他们在做 Wagtail 任务的模型评测,得不停试各家新出的模型,这部分用量也算不到 GLM 头上。

评测结果他们先放出了一张表:14 个模型跑 Wagtail 任务,排第一的是 DeepSeek V4.1 Flash,准确率 95%,能耗 14.9 Wh,每个任务 0.09 美元。便宜模型能不能干活,这张表给了具体数字。
对比一下:选错一次模型花了 150 美元,是 GLM 5.3 Flash 整月开销(68 美元)的两倍多。账单大头不在模型单价,在什么活交给哪个模型。
💡 主厨说:他们 10 月的目标改成按花费和能耗来算,不再看 token 数。你要是也只盯着 token 用量,可以在旁边加一列花费。
来源:
Janus:一个 Go 二进制,用 Vulkan 在 AMD 显卡上跑 GGUF
Janus 是个单文件 Go 二进制,把 .gguf 模型跑在本地,对外暴露 OpenAI 兼容的 API。它不依赖 Python、Docker,也不需要 Ollama——Windows 上就是一个 .exe,Linux/macOS 上 go build 出来一个可执行文件。推理走 llama.cpp 的 Vulkan 后端,AMD、Intel、NVIDIA 都能用,没有 Vulkan 就退回 CPU。
接入很简单:默认端口是 8990(不是 8080),Base URL 填 http://127.0.0.1:8990/v1、API Key 留空,就能接进 Cursor / Cline。换模型调一下 /models/load 就行,不用重启进程。带 <think> 的推理模型,思维链会单独放进 reasoning_content。每个模型在磁盘上通常 2–8 GB,Janus 本体加 llama.dll 约 50 MB。
README 里列了几个坑:Windows 上 Go 没法覆盖正在运行的 .exe,改完代码没生效先去任务管理器把 janus.exe 全结束;端口被占也是同一个原因。首次对话要等 10–60 秒,那是模型往显存里加载,Q4 量化会快一些。Linux 需要把 libllama.so 放在二进制旁边或 LD_LIBRARY_PATH 里。原文没说它在多卡、大模型上的表现,也没给任何性能数字——它是 llama.cpp 外面套的一层壳,上限就是 llama.cpp 的上限,别指望它比上游更快。
来源:
Pi 1.0 正式版发布,同天还出了长时运行框架 Pi Durable
Earendil 发布了 Pi 1.0,官方说每周有几十万人在用。这版新增 Codemode(原生支持 MCP)、虚拟模型扩展、工具延迟加载、Anthropic 模型的缓存预热、对话中途插入 system message,还换了新 TUI 主题、默认全屏。安装还是一行 curl(Windows 用 PowerShell),文档在 pi.dev。
官方的说法是,agent 工具每周都在变,但多数改动留不下来,所以 Pi 只收已经被证明有用的功能。想做长时间运行、能从多个入口接入的 agent,不适合硬塞进 Pi,于是同天单独发了实验包 Pi Durable。它不替代 Pi,是用来搭长时运行 agent 应用的框架:每一步都是带 checkpoint 的 task,进程挂了,新进程打开同一份存储就从断点接着跑;没跑完的模型请求会重发,能安全重跑的工具调用会重跑,requestId 保证同一次提交只算一次。存储自带内存、SQLite、JSONL 三种,SQLite 和 JSONL 不依赖 Node API,加个小适配器就能跑在 Bun 或 Cloudflare Durable Object 里。
Pi Durable 源码不含测试约 1.5 万行,折合 GPT 约 15 万 token、Claude 约 25 万;官方说让 agent 读源码时,存储后端那 3000 行一般可以跳过。如果你只是在终端里跑 coding agent,Pi 1.0 就够用;Pi Durable 还是实验包,等真要做长时运行的 agent 应用再看不迟。
来源:
Bez 想从规范自动生成浏览器引擎,目前覆盖率 0.6%
项目叫 Bez,思路是从规范文本和 WPT 测试里生成一个 Web 渲染引擎,用三个已发布的浏览器互相校验,Rust 占 76%。它给的目标挺实在:默认构建是完整引擎,也可以按站点实际用到的特性裁剪,用不到的代码直接不进二进制,引擎小、内存少、好嵌入,规范一变就重新生成而不是手改。但看它自己公布的状态表,对着 browser-compat-data 8.0.4 的 17259 个叶子键,生成部分只覆盖 0.6%,手写 0.3%,93% 还没碰到,HTML、JavaScript、SVG、WebAssembly 全是 100% 未覆盖。手写一个引擎要几百个工程师干好几年,这个判断我认;但从 0.6% 到能跑一个网页,中间隔的不是一条 pipeline,是十几年攒下来的兼容性泥潭。先看懂它怎么把一条规范变成可验证的代码,再谈值不值得跟。
来源:
Agentic 编程的四个问题:代码难读、人不上心、技能退化、团队变散
一篇博客列了 agentic coding 的四个问题,作者说眼下都看不到解法。一是 AI 写的代码风格怪,人越来越不愿意进代码库;二是不亲手写也不细读,对产出不再上心,功能少了推敲,bug 只打补丁;三是技能用进废退,新人更难学会;四是大家都在跟自己的 agent 说话,团队群聊冷了,同事之间越来越远。没有数据,是一篇观点文,适合拿来对照自己团队的情况。
来源:
如果明天让你把主力模型全押在一家上,你赌它扛得住,还是先留一手随时切?明早 8 点见。
本期从过去 24h 的 X / Hacker News / GitHub Trending 共 59 条信息中挑出 5 条(全天逐小时采写、经事实校对后于晨间选编)。内容由 LLM 辅助生成,每条均附原始来源链接,重要决策请交叉验证。

微信扫码关注「码农早餐」
每天早 8 点推送到微信,不用记网址。关注后回复「价格」,拿大模型价格与退役时间速查表。
喜欢这篇?订阅每日推送
每天 8:00 精选 AI 编程动态,每周六另附一封亲手实测的周刊。
本页内容由 LLM 自动聚合 + 解读生成,每条均有原始来源链接,建议交叉验证。