工具大全
返回情报列表

码农早餐 · 2026-10-07

今日头菜:同样 $200 的 Claude 计划,值多少取决于你跑什么模型。另有 4 条快讯:vibe coding 不如手写代码爽:一篇 HN 热帖把「乐趣前置」说透了;Mistral Large 4 开放预览:1T 参数、49B 激活,权重月底才放;等。

2026年10月7日11 分钟阅读码农早餐

SemiAnalysis 每天重测一遍各订阅的成本,发现同等价位下 Anthropic 折算出的 API 等价价值能到 OpenAI 的 5 倍以上——但只在你跑对模型和 token 类型时成立。所以别问哪个计划值,先问自己每天烧的是输入还是输出。

🍳 今日头菜当天唯一一条深度解读

同样 $200 的 Claude 计划,值多少取决于你跑什么模型

SemiAnalysis 给订阅计划算了一笔账:在同等价位下,Anthropic 订阅折算出的 API 等价价值,可以达到 OpenAI 的 5 倍以上。 但结论有个前提——这个倍数不是固定的,它随「计划 + 模型 + 工作负载」三者变化。

订阅制的本质是:你每月付一笔钱,换到一定数量的「credits」,每个(模型,token 类型)组合消耗的 credits 不一样。关键在于,credit 消耗比例和 API 价格比例并不一致,所以同一个计划的价值,会因为你跑的是哪个模型、输入还是输出为主而大幅波动。原文的说法很直接:孤立地说「这个计划值 X 美元」没有意义,你得看完整的(计划、模型、工作负载)组合。而且这个组合还在变——厂商随时可以靠调 credit 成本悄悄改限额,促销和新模型发布也会公开调整。SemiAnalysis 的做法是每天重新测一遍每个(计划、模型、token 类型)的成本,把变化实时暴露出来。

同样 $200 的 Claude 计划,值多少取决于你跑什么模型

怎么测的?他们一次只隔离一种 token 类型,跑重复调用来观察厂商的用量表走了多少。输入、cache write、cache read 共用同一套 prompt 模板,用《战争与和平》的片段,因为塞大段乱码有些模型会直接拒答;测输入时每次调用加随机 tag 保证不命中缓存,测 cache read 时用固定 tag 让第一次写缓存、之后每次读。测输出则用一篇技术文章逼出长输出,因为「把 SemiAnalysis 重复十万次」这种机械 prompt 会被拒。每次调用记录两件事:厂商计费的各类 token 数,以及用量表读数。由于单次请求常常推不动表,他们按「步」来测——两次表动之间累计的 token 数,就是表走一格的成本,首尾两个不完整的步直接丢掉。

对写代码的人来说,这意味着两件事。一是选订阅别只看价格和「比 Plus 多 5 倍用量」这种相对宣传——OpenAI 曾用「Expanded Codex usage」「5x more usage than Plus」「20x more usage」来标价,后来把 $200 计划用量砍半,并把相对用量从定价页上撤了;相对倍数本身就不稳定。二是你自己的账单取决于工作负载:以 cache read 为主的 agent 循环和以 output 为主的长文生成,吃掉的额度完全不是一个量级。原文还给了订阅对厂商财务的分量——订阅只占 Anthropic 总收入约 10%,却能吃掉超过 40% 的推理算力,把混合后的每兆瓦收入拉低约 3600 万美元。这也解释了为什么限额总是被反复调整:它牵动的不是零头。

💡 主厨说:这条最实用的地方是它把「计划值多少钱」拆成了可复算的三元组——你完全可以自己搭个小脚本,固定一种 token 类型跑,看用量表走一格吃掉多少,比看任何对比图都准。

来源:

🍲 今日硬菜 · 2 条深读

vibe coding 不如手写代码爽:一篇 HN 热帖把「乐趣前置」说透了

一篇讲 vibe coding 的随笔冲上了 HN,标题直接摆出结论:vibe coding 不如手写代码爽。作者不否认 AI 让他做出了以前做不出的东西——一个「这链接是不是已经上过 HN」的 bookmarklet、一个预测市场模拟小游戏、一个基于 Pyronear 的野火早期预警系统(用免费 plan 的 Lumo,两个下午跑通,能在点火画面里认出第一帧烟),还有一个 Kobo 阅读器数据库迁移助手。这些他大多不会手写,因为不值得花几周。但他把「爽」拆成了六个来源:点子的兴奋、把点子做出来的兴奋、苦战后的成就感、把活干漂亮的满足、学习本身的兴奋、解决自己真实问题的满足。vibe coding 稳定给到的是第 1、2、6 条,第 3、4、5 条不是它的自然产物。

这个拆法比「AI 好不好用」的站队有信息量。他把 vibe coding 的核心机制叫「把乐趣前置」(frontload the fun):想法一冒出来,几分钟就有能跑的原型,多巴胺立刻到账。代价在后面——重构 vibe 出来的代码一点都不刺激。他还打了个比方,说这像一连串初次约会:你没跟项目建立关系,也就拿不到那种黏糊糊的归属感。另一个说法更扎心:vibe coding 在你和现实之间插了一层,你像一个大公司的高管,事情看起来都成型了,但总怀疑底下有人在摸鱼或者搞破坏,除了继续往里砸钱和喊得更大声,你没什么可做的。他甚至引了「dangerously-skip-permissions」来形容自己配的自动批准 hook——写代码的人看到这个词会笑一下,然后心里咯噔。

对每天在写代码的人来说,这篇的价值不在「该不该用 AI」,而在它给了一个自查的坐标。你最近一次因为一段代码而高兴,是因为它跑起来了,还是因为你想明白了它为什么能跑?前者的半衰期很短,重复几次就钝了;后者会累积。作者也没把话说死,他承认手写代码经常不快乐——第一次写 Go、第一次跟 Rust 编译器较劲二十来行,都是认证过的不快乐,但那属于「二类乐趣」,事后给你成就感和「我搞定了」的感觉,而且下一次会更容易。所以真要用 AI,值得挑那些你本来就不会做、也不打算学的事,把省下的时间投到你想真正搞懂的那一块去。至于他这篇随笔,据他自己说,大纲是烛光下用蓝墨水写的,AI 连错别字都不许改。

来源:

Mistral Large 4 开放预览:1T 参数、49B 激活,权重月底才放

我们前几期聊过 Mistral Large 4 发布,当时的结论是欧洲旗舰模型更新到第四代。今天这条不是新发布,是它正式开放公开预览——写代码的人从「知道有这么个模型」变成「今天就能调 API」。代号「Le Chonk」也是这次披露的,官方自己说「非正式叫 ML4,非常正式地叫 le Chonk」,一个 1T 参数的模型起名叫胖猫,欧洲人取名的松弛感确实独一份。

先把规格说实:1T 总参数、49B 激活,原生多模态,在 Mistral 自己的欧洲数据中心用 3800 张 NVIDIA Grace Blackwell 训练。现在就能在 Mistral Studio 上试预览 API,但权重月底才放,官方说这段时间要拿真实环境做 red-teaming,合作方拿到的是「降低审核、扩展网络能力」的同一版本。几个能对上的数字:DeepSWE v1.1 61.7%、SWE-Atlas-QnA 59.4%、Terminal-Bench 4 只有 28.3%,Coding Agent Index 综合 49.8%,压过 DeepSeek V4 Pro 0813 和 Qwen3.8 Max;Surge AI 的盲测里排第二(3.74),第一是 Claude Opus 5 的 4.22。宣传口径里最响的一句是「美国或欧洲最好的开放权重模型」——注意限定词是「美国或欧洲」,把中国那批开源模型从比较里划出去了,这种自己划赛道的排名,看的时候心里得有数。另外视觉 grounding 上 Dense 200 是 42% 对 GPT-6-Astra 的 41%,一个百分点的「超越」,属于赢在误差范围内。

对我们来说最实际的一条是权重。API 今天可用,但自部署要等到月底——想把它塞进自己的 pipeline、或者拿它跑离线代码补全的,现在只能先接 API 试手感,别急着改架构。另一条被官方重点讲的是网络安全场景:他们称 Claude Opus 5.5、GPT-6 Astra 在「复现漏洞再打补丁」这类测试上接近零分,因为拒答,而 ML4 拿到 82%、Cybench 40 题解掉 93%。这个对比有它的道理,闭源模型的安全过滤确实会挡住合法的漏洞研究;但也要看清,这套能力是配合降审核版本一起放出来的,自己部署之后怎么设边界,是你的事,不是它的事。

来源:

🥢 配菜 · 另外 2 条

Claude Code 建议消息:真客户可能是模型不是你

前几期我们聊过 Claude Code 让工程师觉得被榨干、体验偏负面。今天这条是同一产品的新侧面:那个「建议消息」功能,作者认为真正的客户是模型,不是人。之前看的是人类工程师的体验,今天看的是产品设计到底服务谁——两个视角不冲突,反而互相解释。如果这条让你对 Claude Code 的评价反转,转折点就在这:功能不是为你省事,是为让模型跑得更顺。我倾向于先问一句,这功能在什么数据上被验证有效。

来源:

12 小时只按回车:Claude Code 被指榨干工程师

一位工程师在 X 上匿名发帖,说自己所在的公司里,从产品规格、测试到工单和报告全由 Claude Code 生成,人一天干 12 到 13 个小时,主要动作就是按回车。他形容这份工作「灵魂被榨干」,并说 L1 到 L7 的工程师都在做同一件事:跟 Claude 说话。他不反对用 AI,反对的是没时间 review 生成出来的代码、没人真正在解 bug。帖子里管理层的衡量口径是 sprint 周期、PR 数量和上线功能数——这几个数字凑一起,谁还愿意花两小时读一段 diff?我坐过评委席,看的是你能不能讲清自己改了什么、为什么这么改,按回车按不出这个。

来源:


你手头这摊活,是继续按模型逐个算 credit 成本,还是干脆换成按 API 实付?明早 8 点见。

本期从过去 24h 的 X / Hacker News / GitHub Trending 共 61 条信息中挑出 5 条(全天逐小时采写、经事实校对后于晨间选编)。内容由 LLM 辅助生成,每条均附原始来源链接,重要决策请交叉验证。

码农早餐公众号二维码

微信扫码关注「码农早餐」

每天早 8 点推送到微信,不用记网址。关注后回复「价格」,拿大模型价格与退役时间速查表。

喜欢这篇?订阅每日推送

每天 8:00 精选 AI 编程动态,每周六另附一封亲手实测的周刊。

本页内容由 LLM 自动聚合 + 解读生成,每条均有原始来源链接,建议交叉验证。

码农早餐 · 同样 $200 的 Claude 计划,值多少取决于你跑什么模型 | Magic Tools | Magic Tools