码农早餐 · 2026-09-29
今日头菜:一句「不要猜」,编造率从 71% 掉到 20%。另有 4 条快讯:Go 的 import 路径绑死在 GitHub:换一次托管要动多少代码;Sonnet 5.5 发布:Terminal-Bench 从 10.3% 跳到 70.6%;等。
在提示词里加一句「不要猜」,同一批模型、同一个任务,编造的说法就从 71% 掉到 20%。我信这个方向:很多所谓的幻觉,其实是我们没要求它闭嘴,约束给到位,模型才肯把不知道的留白。
一句「不要猜」,编造率从 71% 掉到 20%
有人在 benchmark 上试了一招:在提示词里加一句「不要猜」,模型编造的说法从 71% 降到 20%。同一批模型,同一个任务,只改了这句话。另一边,Anthropic 的 Opus 5.5 提示词文档也在讲同一件事——输出 token 比 Opus 5 快 30% 以上,但行为差异得靠 prompt 和 harness 去校准,比如让它标出用户粘贴的文本、给无人值守的 agent 补进度信号。模型的上限由数据决定,不由宣传决定;一句约束能砍掉一半以上的胡编,说明很多「幻觉」其实是没被要求闭嘴。

来源:
- Calling the AI bluff: Adding "Do not guess" cut made-up claims from 71% to 20%
- Prompting Claude Opus 5.5
Go 的 import 路径绑死在 GitHub:换一次托管要动多少代码
Go 有个挺讨喜的设计:import 路径本身就是代码的下载地址。你写 import "github.com/thetrueares/boneclone",go 工具链就知道去 GitHub 拉。好处是找 bug 报告地址、分发库都不需要中心化的包管理,坏处是——你的代码从此和托管商绑死了。
作者 Iain Cambridge 把这个代价说得很直白:哪天你想从 GitHub 搬到 GitLab,就得改代码,否则拉到的还是旧版本。迁移的活儿一多,人就干脆不搬了。他见过一家公司同时用着 GitLab、GitHub 和 Azure DevOps 三套托管,原因不是技术上需要,而是改代码位置这件事工作量太大、又「没时间」,于是宁可多付两份托管费。这已经不是审美问题,是账单问题。
解法是给自己的包配一个自定义域名,比如 go.iain.rocks、go.uber.org、go.mongodb.org 这类。域名指向哪,用户不用管——go.iain.rocks/boneclone 现在指向 GitHub 上的仓库,哪天换到 GitLab,安装命令一个字都不用变。落地靠两样东西:一段 Nginx 配置,判断请求里有没有 go-get=1 这个 query 参数,有就交给 Go 工具链读 HTML,没有就把真人访客 301 跳到 GitHub;再加一个 index.html,用 go-import 和 go-source 两个 meta 标签声明「这个域名对应的仓库在哪、源码浏览链接怎么拼」。作者把自己的配置原样贴了出来,照着改域名就能用。
他的结论是:每个用 Go 做商业开发的团队,内部库和包都应该走自定义域名。这话我同意,而且不用往大了想——你现在不迁,不代表以后不迁,而这件事的成本是随引用它的地方变多而上涨的。域名先占住,主动权就在自己手里。
来源:
Sonnet 5.5 发布:Terminal-Bench 从 10.3% 跳到 70.6%
Anthropic 放出了 Claude 5.5 家族的第二款模型 Sonnet 5.5。官方口径是「比 Sonnet 5 快 30% 以上、大多数任务成本低最多 30%」。但真正扎眼的数字不在宣传语里,而在评测表上:Terminal-Bench 4.0 这个 agentic coding 评测,Sonnet 5 只有 10.3%,Sonnet 5.5 直接干到 70.6%。同一代模型内部的差距拉到近七倍,这不像是「清晰升级」,更像是把上一版没做完的活补上了。
价格没动,输入每百万 token 2 美元、输出 10 美元、缓存读取 0.20 美元,跟 Sonnet 5 一样。所谓「成本降 30%」不是降价,是同一件事用的 token 变少了——官方原话是「typically needs far fewer tokens」,测试里每个任务最多省 30%。这个区别值得记住:账单是按 token 结的,单价没变,省下来的钱取决于你的任务到底能省多少 token,不是所有活都打七折。Slack 那边的反馈是输出 token 少了约 14%,可以当个参考锚点。另外它和 Opus 5.5 的定位分得很开:Sonnet 5.5 强在边界清楚的日常活、修 bug、做文档和表格,Opus 5.5 仍然在需要持续判断的开放式任务上明显更强。官方自己也在下面写了「benchmark 只反映能力的一个切面」。
有两处细节比跑分更该看。一是默认 effort 档位:Claude Code 和 App 里默认 Medium,Platform 默认 High。官方图表里,Sonnet 5.5 在 Low 或 Medium 档就能超过 Sonnet 5 的最好成绩,而每个任务的成本不到后者的十分之一——也就是说,你什么都不改,可能已经在省钱,但如果你手动把档位拉满,省下来的那部分会还回去一部分。二是安全侧:这是第一个带着 cyber safeguards 上线的 Sonnet 模型,理由是它的网络安全能力和 Opus 5 相当。官方说这类防护只针对一小撮高风险请求,日常开发和大部分生命科学工作不受影响——信不信先放一边,如果你的 pipeline 里有安全相关的自动化任务,值得先跑一遍看看有没有被拦。Haiku 5.5 官方说几周内加入,做高并发、成本敏感场景的可以先等等再选型。
来源:
Imp:把 DSPy 搬到 BEAM 上,Agent 变成一个进程
DSPy 那套「把每次模型调用写成有类型、可测量的函数」的做法,现在有了 Elixir 版本。Imp 是全量移植:signature、module、optimizer、agent loop、retrieval 都在,跑在 OTP 上。差别在于 Agent 的形态——在 BEAM 里它就是一个进程,自己持有状态、收消息、挂在 supervisor 下,跟你的应用一起被监管。写代码的方式也变了:不写 prompt、不写 parser,用 Imp.signature 声明输入输出,kind 这类字段要么是枚举里的值,要么直接报错。优化环节给了 GEPA、MIPROv2、SIMBA 等几条路,GEPA 会读失败样本重写指令,max_metric_calls: 300 就是它的预算上限,改完的程序能存成 JSON、当 diff 审。要不要上手,先看两件事:你的技术栈是不是本来就在 BEAM 上,以及你愿不愿意为「可测量」多写一层声明——移植版的价值不在功能对齐,在于并发和容错是白拿的。
来源:
全员问 Claude:代码能跑,没人知道为什么
一篇 871 字的短文引了一段大厂工程师的自述:入职半个月,spec、代码、测试、PRD、ticket、报告全由 Claude Code 生成,从 L1 到 L7 干的是同一件事——跟 Claude 说话,每天干 12 到 13 小时只为按回车。作者说真正的问题不是 AI 写的代码,而是没人再知道系统架构和当初为什么这么选。数据工程被单独拎出来当反例:那批人从第一天就被迫搞懂业务,AI 只是帮他们省了摩擦。我认同这个区分,但更在意后半句——省掉的摩擦里,有一部分本来就是理解本身。你可以让 AI 写,但架构决策和意图得有人能讲出来,否则下一个改动就是盲改。
来源:
你手头那些让模型自己填的活,敢不敢加一句「不知道就说不知道」再跑一遍?敢,还是先看看效果再说。明早 8 点见。
本期从过去 24h 的 X / Hacker News / GitHub Trending 共 72 条信息中挑出 5 条(全天逐小时采写、经事实校对后于晨间选编)。内容由 LLM 辅助生成,每条均附原始来源链接,重要决策请交叉验证。

微信扫码关注「码农早餐」
每天早 8 点推送到微信,不用记网址。关注后回复「价格」,拿大模型价格与退役时间速查表。
喜欢这篇?订阅每日推送
每天 8:00 精选 AI 编程动态,每周六另附一封亲手实测的周刊。
本页内容由 LLM 自动聚合 + 解读生成,每条均有原始来源链接,建议交叉验证。