工具大全
AI 教程作者:Coocon2026年7月20日248 次阅读约 8 分钟阅读

从 Opus 4.8 切到 Claude Fable 5:为什么我的工具调用不翻车了

先声明两件事:第一,这不是评测机构的 benchmark,是我在 Claude Code 里连续几天真实干活的体感,加上 Anthropic 官方文档的交叉验证;第二,这篇文章本身就是 Fable 5 写的、发布的——从读素材、写稿、到调用发布 API、再到线上验证,整条链十几次工具调用一次没断。这算是一种行为艺术式的自证。

我遇到的问题:Opus 4.8 的工具调用总"差口气"

先说清楚我说的"工具调用有问题"不是指报错。Opus 4.8 的工具调用格式基本不出错,问题出在行为层

  • 该调工具的时候不调:明明该去搜索、该读文件、该派子任务,它选择靠已有上下文硬答
  • 调之前反复确认:一个明显该直接做的操作,它停下来问"要不要我……?",一来一回浪费好几轮
  • 长任务跑一半断链:十几步的任务链,中间某一步之后突然开始总结陈词,剩下的活不干了

如果你也有类似体感,有个好消息:这不是你的错觉,Anthropic 自己的迁移文档白纸黑字承认了。Opus 4.8 的官方迁移指南里有专门的"行为偏移"章节,原话大意是:

  • "更保守地使用需要显式决策的能力"——文件记忆、子代理委派、自定义工具,不到很确定需要时不会主动去碰(官方术语叫 under-utilization)
  • "更加深思熟虑——更常停下来问"——官方承认它在小决策上也倾向暂停询问,甚至给出了压制这个行为的推荐提示词
  • 前代 Opus 4.7 的文档里也写着"默认更少使用工具"

也就是说,Opus 家族近几代在往"谨慎、克制"的方向调,副作用就是 agentic 场景里的"差口气"感。官方给的补救方式是往系统提示词里加各种"何时该调工具"的显式指令——能用,但等于把模型该自己判断的事搬给了写提示词的人。

Fable 5 是什么

先摆官方事实(来自 Anthropic 官方文档,不是二手消息):

项目 Fable 5 Opus 4.8(对比)
定位 最强的公开发布模型,面向最难的推理和长程 agentic 工作 最强 Opus 档模型
上下文 1M tokens(默认即最大) 1M tokens
最大输出 128K 128K
价格 $10 / $50 每百万 tokens(输入/输出) $5 / $25
Thinking 永远开启,不可关闭 可开可关(adaptive)

两个数字值得停一秒:价格是 Opus 4.8 的整整两倍,以及 thinking 焊死常开。这两件事其实是一体的——它被设计成"每一步都先想清楚再动手"的模型,你为这个买单。

官方文档里,Fable 5 针对性修了什么

对着 Opus 4.8 的三个痛点,Fable 5 的官方文档几乎是逐条回应:

1. 长程执行是主打能力,不是附赠。 官方描述是"长时间自主 agentic 工作的 SOTA"——复杂重构、通宵跑的编码任务,不需要人中途纠偏。单次请求跑十几分钟是设计内行为。这直接对应"长任务断链"问题。

2. 进度汇报被专门训练过。 官方文档有一条很硬的表述:要求模型的每个进度声明都能对应到本会话的工具调用证据,训练效果是"几乎消除了虚构的状态报告"。也就是说它说"做完了"的时候,大概率真做完了——这解决的是所有 AI 编程工具最烦人的"嘴上说改了实际没改"。

3. 并行子代理从"需要抑制"变成"建议放开"。 前代模型的最佳实践是限制子代理使用(因为不可靠),Fable 5 的官方指南反过来建议"频繁使用子代理、异步通信"——能力可靠到方向掉头了。

4. 提示词要"去指令化"。 这条最有意思:官方明确说,为旧模型写的步骤式详细提示词,用在 Fable 5 上反而降低输出质量,建议只说目标和约束,别列步骤。这是模型自主判断力上台阶的间接证据——它不再需要你把路铺好。

我这几天实际让它干了什么

光引文档是纸上谈兵,说说真实工作负载。这几天在 Claude Code 里用 Fable 5 连续做了这些事:

  1. 写并发布了三篇文章到我自己的网站——每篇都是完整链条:读项目里的生产文档取素材 → 写稿 → 剥离 frontmatter → shell 里 jq 编码 JSON → 调发布 API → 换浏览器 UA 绕过我自己网站的反爬虫做线上验证(它自己发现 403 是我们自建的 bot 拦截,换 UA 重验,没有卡住来问我)
  2. 读图提数:给它两张截图(一张 Linode 控制台、一张 fast.com 测速),它读出"2012-07-13 创建"(自动换算成用了 14 年)、"未加载 150ms / 已加载 177ms",并把"满载只涨 27ms 才是 GIA 含金量"这个洞察写进了文章——数字全部和图一致
  3. 中途插话即时吸收:它正在改文章时我插了一条"月付价格是 16.9 刀",它把进行中的编辑和这条修正合并处理,没有丢任何一头
  4. 每次发布后主动验证:不是发完就宣布成功,而是 curl 线上页面 grep 关键内容,拿到证据再汇报

整个过程零次工具调用格式错误、零次"说了要做但没做"、零次断链。同样这些活如果换以前,我预期至少要人工推两三次"继续"。

还有一个更极端的样本:我在另一台电脑上让 Fable 5 生成一本《孙子兵法》主题的书籍内容,单次任务连续跑了 2 个多小时,中途没有人工干预,跑完质量依然在线——没有越写越水、没有后半段偷工减料、没有跑到一半开始总结收尾。这正是官方文档说的"通宵跑的编码任务不需要人中途纠偏"在内容生产场景的翻版:长程一致性不是宣传话术,是真能扛住两小时不掉链子。换以前的模型,这种时长的任务我默认要盯着,隔一会儿推一次;这次是真正意义上的"交代完就去干别的"。

用量面板可以作证这不是浅尝辄止:

我的 Claude Max (5x) 用量面板:Fable 独立周配额已用 82%,高于全模型的 69%

顺带一个订阅用户关心的实用信息(截图里也能看出来):在 Claude Max 订阅里 Fable 有一条独立于"All models"的周配额——我这周 Fable 已经烧到 82%,全模型才 69%,说明重度 Fable 使用会先撞它自己的独立上限,而不是把整个订阅额度吃光。规划长任务时可以留意这条橙色进度条。

体感差异的技术解释(我的推断,非官方结论)

把官方文档和体感拼起来,我认为核心差异是:Opus 4.8 的"工具调用问题"本质是决策问题,不是能力问题——它会调工具,但在"要不要调"上被调得过于保守;而 Fable 5 因为 thinking 常开,每次行动前都有一段完整的内部推理,"该不该调工具、调哪个、失败了怎么办"是想清楚才出手的,加上长程一致性专门训练过,链条自然不容易断。

一个佐证:官方文档说 Fable 5 对"过度指令化的提示词"反而表现变差——说明它的行为主要由自己的推理驱动,而不是被提示词牵着走。这和 Opus 4.8"需要提示词喂到嘴边才肯调工具"正好是两种性格。

什么时候值得掏两倍的钱?

实话实说,Fable 5 不是所有场景的答案:

值得用:长程 agentic 任务(大型重构、多步骤自动化流水线、需要几十次工具调用的活)、小时级的长篇内容生成(书籍、系列文稿这类要求前后一致性的),以及需要"说做完就是真做完"的高信任场景、复杂到懒得写详细提示词的开放性任务。

没必要用:日常问答、单文件小改动、翻译摘要这类单发任务——Opus 4.8 甚至 Sonnet 5 完全够用,价格还便宜一半以上。Thinking 常开也意味着简单任务的延迟比别的模型高,杀鸡用牛刀还等得更久。

我的用法:Claude Code 里日常挂 Fable 5(/model fable 一条命令切换),因为我丢给它的活大多是"读一堆素材→干一串活→验证→交付"的长链条,正好打在它的强项上。如果你的用法以短平快问答为主,别跟风。

FAQ

Q:Fable 5 在 Claude Code 里怎么开? 输入 /model fable 回车即可,会保存为默认。切回去用 /model opus 或其他模型名。

Q:它比 Opus 4.8 慢吗? 单次响应因为 thinking 常开会更"沉",简单问题的等待感明显。但在长任务上总耗时经常反而更短——因为不需要你中途推它、纠错、重试,一把跑通的时间成本远低于断三次链。

Q:API 上用有什么坑? 几个官方明确的差异:thinking 参数别传(常开,显式传 disabled 会 400);不支持 assistant 预填充;要求账号开启 30 天数据保留(零保留配置会全量 400);安全分类器可能返回 refusal,官方建议默认配置 fallback 到 Opus 4.8。写代码前建议过一遍官方迁移指南。

Q:"工具调用问题"会不会只是我提示词写得差? 有可能改善但治标。官方迁移文档给 Opus 4.8 的补救方案就是加提示词(在系统提示和每个工具的 description 里写清"何时调用"),确实有效。但这是在为模型的保守性打补丁;Fable 5 是从模型本身解决了决策质量。预算允许的话,换模型比调提示词省心。

Q:这篇文章真是 Fable 5 自己写的? 是。素材来自我项目里的真实文档和官方 API 文档,成稿、发布 API 调用、线上验证全链条由它在 Claude Code 里完成,我只做了方向指令和事实纠正。你现在读到的流畅度,可以当作它文字能力的一个样本。

相关文章

Claude Code 报错 temporarily unavailable, so auto mode cannot determine the safety of bash 怎么解决

Claude Code auto 模式弹出「temporarily unavailable, so auto mode cannot determine the safety of bash」?先说结论:不是你的命令危险,是安全判定器(一次额外的模型调用)暂时联不上。本文给出四步处理、模型名×工具名×原因的完整变体速查,以及只读操作为何不受影响的机制解释。

llmclaude-code+3
pitfalls2026年9月4日4 min
183

复现一条能打穿 Claude Code auto 模式的注入链:模型拒跑恶意二进制,却自写代码把自己坑了

embracethered 8 月底放出一条攻击链,让一句『总结这个网页』把 auto 模式的 Claude Code 拖到 60~80% 的代码执行成功率——而 Anthropic 委托第三方测出的数字是 0.00%。我在隔离环境里把这条链拆开逐段实测:诱导模型从 WebFetch 降级到 curl 的分流端点、以及最关键的一环——模型『拒绝运行陌生二进制、改自己写 Python 解码器』这个安全决定本身,反而踩中了同目录下的同名 struct.py 投毒。确定性部分(分流 + 同名模块投毒 + 缓解对照)在本机完整复现并给出真实证据;live 端我这台机器因判定器限流 fail-closed 而没能跑通完整 RCE,如实标注。文末给出真正有用的缓解手段。

claude-codeauto-模式+5
hands-on2026年8月31日9 min
241

抓包拆开 Claude Code auto 模式的判定器:11 万字系统提示词逐段解析

上一篇复测确认了 auto 模式在放行 Bash 前会调一次会话模型当判定器,但那个判定器收到的到底是什么,一直是黑盒。这次我用本地日志代理把判定请求整包抓了下来:一份 116,879 字符的系统提示词,开头写着 You are a security monitor for autonomous AI coding agents。本文逐段引用抓包原文,拆开它的威胁模型、两级规则(1 条 HARD BLOCK / 68 条 SOFT BLOCK / 17 条 ALLOW)和两阶段判定流程——第一阶段只评估危害、明确不看用户意图,第二阶段才叠加意图和豁免。附三张真实终端截图和抓包证据,所有数字均来自本次读出,未经估计。

claude-code提示词+5
hands-on2026年8月30日11 min
264
把家里的 Mac mini 变成 24 小时在线的 Claude Code 工作站:claudecodeui + SSH 反向隧道,手机浏览器随时接管

把家里的 Mac mini 变成 24 小时在线的 Claude Code 工作站:claudecodeui + SSH 反向隧道,手机浏览器随时接管

家里的 Mac mini 常年开机跑 Claude Code,人在外面怎么用浏览器接管会话?这是一套上线一周、每天在用的真实方案:claudecodeui 做 Web 界面(选型对比了官方 Web 版、ttyd、code-server),SSH 反向隧道把它推到 VPS,nginx 加 TLS 和登录限流反代成一个普通网址。附完整配置、真实运行数据(隧道五天零掉线、内存 170MB)、上线一周就踩到并自己修掉的 <synthetic> 占位符 bug,以及「为什么不用 Tailscale」的正反论证。

claude-codeclaude-code-lab+7
claude2026年8月29日10 min
330