AI 落地命令行:本地推理的水已经烧开了
AI 落地命令行:本地推理的 iPhone 时刻还没来,但水已经烧开了
上个周末,我在终端里对 Reasonix 说"把这个函数的测试补上"。它读完代码,写了个完整的 test suite,有一个边界条件我还真忘了。
这不是科幻。这就是上周末 GitHub Trending 榜首的项目。
而这只是冰山一角。同一周,antirez 放出了专门为 DeepSeek V4 Flash 优化的推理引擎 ds4。同一周,Wafer 还把 Kimi K3 在 AMD MI355X 上跑到了 952 tok/s。三件事单独看是散点,串起来是一条线:大模型正在从云端的 API 调用,变成你终端里的常驻进程。
Reasonix:不是又一个 AI CLI,是"开着别关"的终端搭档
Reasonix 和之前那些 AI CLI 工具的区别在哪?一句话:它是围绕 prefix-cache 稳定性设计的。
用过 GPT CLI 的人都有这个体验:聊了半小时,token 费用已经够买杯咖啡。原因是每次对话都在重新计算 attention——前缀缓存没利用好。Reasonix 的解法是把缓存稳定性当成一等公民。启动时先注入一个小的环境摘要,过期的工具输出会被修剪、压缩,避免重复计算。
翻译成人话:你开着它,聊一天,token 成本不会线性增长。
技术上它也够轻。一个 Go 写的静态二进制,CGO_ENABLED=0,跨平台一行命令编译。npm 和 Homebrew 都能装。支持多模型组合(executor + planner 分开跑)、插件用 MCP 协议、VS Code 集成。它不是"又一个 wrapper",是个有明确架构主张的工具。
但得说一句:它目前针对 DeepSeek 系模型优化得最好,换别的模型前缀缓存的优势就打折扣了。不是万能药。
ds4:antirez 教你什么叫"窄而深"
如果你不认识 antirez——他是 Redis 的作者。他做软件的思路一直是一招:选一个场景,做到极致。
ds4 就是这个思路的产物。一个专门为 DeepSeek V4 Flash 优化的推理引擎,不是通用 GGUF runner。Model loading、prompt rendering、tool calls、KV state、HTTP server、coding agent——全部在一起设计和测试。
支持的硬件也很务实:Metal 优先(Mac 上 96GB+ 内存能跑),CUDA 支持多卡(8×L40S 实测 120 t/s 聚合生成),ROCm 支持 Strix Halo。想在低配置机器上跑?SSD streaming 走起,速度也能接受。
最让我佩服的是诚实度。README 直接写了"本软件在 GPT 5.5、5.6 和 Claude Fable 的强力辅助下开发,如果你不喜欢 AI 写的代码,这软件不适合你。"——antirez 从不玩虚的。同时也写了:没有 llama.cpp 和 GGML,这个项目就不存在。技术债算得明明白白。
对普通开发者来说,ds4 的意义不是你要马上去用它——它还是 beta 质量,API 在快速变化。意义在于:能在自己硬件上跑顶级模型的推理引擎,有人真的在做,而且开源。
Wafer × Kimi K3:AMD 在推理上的逆袭
先看数据——
在 1024 token 输入 / 400 token 输出的基准上,一台 8×MI355X 节点跑 Kimi K3:
- 单流解码:118 tok/s(B200 TP16 只有 90 tok/s)
- 峰值吞吐:952 tok/s(B200 TP16 的 498 tok/s 是两台机器捆一起的数据)
- 每美元性能:48 tok/s/$(B200 只有 7 tok/s/$,B300 是 33 tok/s/$)
为什么 MI355X 这么猛?答案在显存。Kimi K3 是个 2.8T 参数的巨兽,B200 单节点 8×192GB 装不下权重 + 1M token 的 KV cache,必须跨节点。而 MI355X 单卡 288GB HBM,刚好塞得下。Wafer 称之为"显存护城河"——模型越大,大显存 GPU 的优势越明显。
当然有水分的:这是 Wafer 自己在自己硬件上测的数据,不是第三方基准。他们用的投机解码 draft 是第三方 RadixArk 提供的,ROCm 版本还遇到了一堆兼容性问题(top_k_renorm_prob 未定义之类的)。但方向是对的:AMD 在推理场景的性价比确实在追上来。
信号已经够强了
三件事放在一起看,信号很清楚。终端 AI 工具正在从"好玩"变成"能用"——Reasonix 和 ds4 都不是 demo,是真有人在日常用的工具。本地推理的硬件门槛也在往下掉,MacBook M5 Max、DGX Spark、Strix Halo,这些都是消费级或准消费级设备,不是数据中心专属。再加上 AMD 在推理性价比上摸到了门道:大显存配大模型,天然合拍。
但也有不该忽略的冷水:
- 这些工具还太新,API 不稳定,文档不全
- 本地推理意味着你要自己管模型下载、更新、兼容性——不是开箱即用
- Wafer 的数据是自己测的,等第三方验证再说
- 目前所有工具都押注 DeepSeek/Kimi 生态,模型更新换代时怎么办?
今天你可以做的
别光看。花 30 分钟动手试试:
- 有 Mac?
brew install esengine/reasonix/reasonix,跑一遍 setup,让它帮你改一行代码。感受一下不用打开浏览器调 ChatGPT 是什么体验。 - 有 96GB 以上的 Mac 或者 NVIDIA 卡?clone antirez 的 ds4,跑一个 DeepSeek V4 Flash 看看响应速度能不能替代你现在用的云端模型。
- 做基础设施的?查一下 AMD MI355X 的云服务价格,算算如果你的推理任务放在上面,成本能降多少。
本地推理的 iPhone 时刻还没来。但水已经烧开了,现在不下锅,等别人把菜端上来就晚了。
参考来源:
✨ 本文由 DeepSeek 生成初稿,Claude 审核润色。