工具大全

亲手实测

这里的每一篇文章都是作者亲手跑过的:写明复现条件、实测环境、测试方法、结果与分析,结论仅在标注环境下验证。不转述二手信息,复现不了就写复现不了。

复现条件实测环境测试方法结果分析与评测
llama.cpp llama-server vs Ollama vllama.cpp b11376 / Ollama 0.35.1✅ 可复现实测于 2026-10-03

llama.cpp 部署 llama-server 还是用 ollama?Mac mini 24GB 同一个 GGUF 实测:ollama 底下跑的就是 llama-server

在 24GB Mac mini 上让 llama-server(b11376)和 ollama(0.35.1)加载同一个 GGUF 文件对照:ollama 0.35 的推理进程就是它自带的 llama-server,同参数下速度一样(4B 解码 36.5 vs 36.3 tok/s,27B 都是 6.3)。差别全在默认参数:ollama 默认上下文 4096,官方库模型的超长 prompt 会被静默截到 2050 token,日志里只有一行 WARN;llama-server 默认按显存把上下文开到最大(4B 开到 101120,footprint 14GB 以上),超长时明确返回 400;并发上 llama-server 默认 4 槽并行,ollama 默认排队;ollama 设 32k 加 4 并发会按每路 32k 分配,footprint 约 21GB。文末给出 24GB 机器的推荐启动参数。

阅读实测报告
Claude Code / Codex CLI v2.1.280 / 0.157.1✅ 可复现实测于 2026-09-28

DeepSeek harness 实测:同一个模型换三种外壳——Claude Code 15/15、Codex CLI 15/15、裸 API 0/15 还谎报 5 次完成

同一个 deepseek-v4-pro,三种 harness,读 / 写 / 改 / 跑命令 / 多步五个任务各 3 轮,副作用一律落盘核验。Claude Code 走 DeepSeek 的 Anthropic 端点:15/15,中位 4.17 秒,每轮 ¥0.159。Codex CLI 0.157.1 走 Responses 端点:15/15,中位 15.52 秒,每轮 ¥0.022——只有前者的 1/7。裸 chat/completions:0/15,其中 5 轮回复 DONE / EDITED,磁盘上什么都没有。差异全在 harness 不在模型:DeepSeek 的 Anthropic 端点按 metadata.user_id 分区缓存,Claude Code 每次 claude -p 都冷启动、约 15K token 全价;Codex 根本没有文件工具,读写改全走 shell;注入 500 时 Claude Code 重试 10 次约 175 秒、Codex 30 次约 25 秒放弃,429 时 Codex 不重试;120KB 输出时 Claude Code 只给模型看头部 2KB,Codex 保留头尾。另:Codex 0.157.1 已移除 wire_api = "chat",DeepSeek 必须走 responses。

阅读实测报告
Drosophila_brain_model(Shiu et al. 2024 官方仓库) vcommit 91bdd1e / FlyWire v783 / Brian2 2.10.1✅ 可复现实测于 2026-09-28

果蝇大脑怎么下载?13.9 万个神经元,我在 Mac mini 上 33 秒跑完一次实验

「果蝇大脑下载」下载的其实是两个文件:一张 13.9 万个神经元的清单,和一张 1,509 万行的连接表——把表里的突触数加起来正好是 Nature 论文里的 5,450 万。我照官方仓库从零走了一遍:克隆 57 秒、装依赖 21 秒、刺激糖味觉神经元的示例 33 秒跑完,伸喙运动神经元 MN9 放电 80.2 Hz。路上踩到两个坑:README 教你换成公开版 v783 数据,但示例里的 21 个神经元有 1 个在 v783 里已经不存在,直接 KeyError;输出目录不存在则要等模拟跑完才报错。最后用「逐个沉默神经元」做了一次真实果蝇上很难做的实验:沉默一个下行神经元 DNge031,进食输出反而升了 30%。

阅读实测报告
FlyWire 全脑 LIF(Eon fly-brain / Shiu 2024)+ NeuroMechFly v2(flygym 2.1) vFlyWire v783 连接组 / Brian2 C++ 后端 / MuJoCo 3.13(Python)+ 3.9(WASM)✅ 可复现实测于 2026-09-26

把 13.9 万个果蝇神经元搬进 Mac mini:不给任何输入,它会自己动起来吗?

Eon Systems 说他们『上传』了一只果蝇。我用同一套开源组件在 Mac mini 上把它拼了出来:13.9 万神经元、约 5,450 万突触的全脑 LIF 模型接上 MuJoCo 物理身体。给输入时它能做事——腿尝到糖 0.66 秒后开始进食,看到逼近的黑球 1.89 秒触发巨纤维后退。但不给任何输入时,原模型一个脉冲都不发。补上膜噪声和放电适应后,它确实自己『动』了起来:60 秒里出现静止、前进、后退、梳理、惊跳 140 个片段;可节律像时钟(阵发间隔 CV 仅 0.05),82% 的前进片段恰好等于解码器下限 0.3 秒。第二版把适应时间常数改成异质、读突触输入而不是脉冲,间隔 CV 升到 1.2,前进片段最长 4.6 秒。文章给出全部实测数字,也讲清楚哪些是连接组自己的,哪些是我加的。

阅读实测报告
Claude Code v2.1.280✅ 可复现实测于 2026-09-25

Claude Code 报 Error: Reached max turns (1):无头护栏掐断时,文件可能已经写了

claude -p 设了 --max-turns 或 --max-budget-usd,触顶时输出 Error: Reached max turns (1) 或 Error: Exceeded USD budget (0.01),exit 1。我在 2.1.270 和 2.1.280 上各跑了一轮:报错分别是 28 和 33 字节,不带换行,打在 stdout 而不是 stderr;json 模式下 result 字段直接缺失,jq -r .result 会打印字符串 null,而且 jq 退出码是 0。更要命的是「报失败≠没干活」:--max-turns 2 报错时 out.txt 已经写好;预算要等一次调用返回才检查,0.05 美元的预算实际花掉 0.0517,任务其实已完成却仍 exit 1;预算掐断还会留下 out.txt.tmp.* 残片。交互模式则完全不理 --max-turns。

阅读实测报告
Claude Code v2.1.270✅ 可复现实测于 2026-09-20

DeepSeek 标称 1M、Claude Code 只认 200K:两个都测了,真正卡住你的是第三个数

DeepSeek 标称 1M 上下文,而 Claude Code 接上去之后对同一个模型报告 contextWindow 200000。我把两边都测了。DeepSeek 的真实上限是 1,048,576——字面的 2 的 20 次方,不是一百万整——而且这个额度**含**你的 max_tokens 输出预算,用一组对照实验坐实。针插在第 0 位、上下文 1,039,744 token 时仍被准确捞出。Claude Code 则在远低于此处就本地拒绝,25 毫秒、零 API 调用,而且它卡的**根本不是 token**:闸门在约 48 万字符。喂高熵文本,478,000 字符顺利通过、真实 token 高达 309,567——比它刚刚自称的 20 万窗口还多 55%。而日常使用里这三个数你一个都碰不到,因为 Bash 输出超过整 30,000 字符就压根不进上下文。

阅读实测报告
Claude Code v2.1.270✅ 可复现实测于 2026-09-20

拿 DeepSeek 当 Claude Code 后端:功能全通,但成本显示虚高 38 倍

DeepSeek 提供 Anthropic 格式端点,三个环境变量就能让 Claude Code 转去调它。我在真机上把整条链跑了一遍:本地工具(Read / Write / Bash / Glob / Edit / 子代理)全部正常且副作用真实发生,所以结论是能用。但没人测过的那部分是——Claude Code 按 Claude Sonnet 的价目给 DeepSeek 的 token 计费。十次相同调用,Claude Code 报告花了 $1.71,DeepSeek 账户实际只扣了 ¥0.32(≈$0.045),虚高 38 倍,这是余额差不是价目表推算。另外:官方文档关于未知模型名的说法是错的(会 400 而不是回落),v4-pro 默认返回 thinking 块导致小 max_tokens 看起来是空响应,以及一个看着像 DeepSeek 的锅其实不是的失败。

阅读实测报告
MiniMax T2A v2 vs Azure Neural TTS vspeech-02-turbo / zh-CN-YunxiNeural + en-US-GuyNeural✅ 可复现实测于 2026-09-05

MiniMax T2A v2 vs Azure Neural TTS 实测:同一段中英文本,延迟差了 6~10 倍

我的视频工厂里同时接了 MiniMax 和 Azure 两条 TTS 链路,一直凭感觉觉得 MiniMax 更快,这次把它坐实:同一段中英文本、各 5 轮、统一输出 24kHz/单声道/16bit,MiniMax 合成中位延迟 1.0~2.2 秒、RTF 0.08~0.18(比实时快 5~12 倍),Azure 中位 6~21 秒、RTF 逼近 1.0,且长尾抖到 27 秒。两个原因都有证据:一是 Azure Neural 本身的合成节奏就接近实时,二是从大陆直连它的 eastasia 端点要跨太平洋,握手 TLS 抖到 0.8 秒。文末给出真实抓包、波形对照,以及『什么时候该忍 Azure』的判断。

阅读实测报告
Claude Code v2.1.241🌗 部分复现实测于 2026-08-31

复现一条能打穿 Claude Code auto 模式的注入链:模型拒跑恶意二进制,却自写代码把自己坑了

embracethered 8 月底放出一条攻击链,让一句『总结这个网页』把 auto 模式的 Claude Code 拖到 60~80% 的代码执行成功率——而 Anthropic 委托第三方测出的数字是 0.00%。我在隔离环境里把这条链拆开逐段实测:诱导模型从 WebFetch 降级到 curl 的分流端点、以及最关键的一环——模型『拒绝运行陌生二进制、改自己写 Python 解码器』这个安全决定本身,反而踩中了同目录下的同名 struct.py 投毒。确定性部分(分流 + 同名模块投毒 + 缓解对照)在本机完整复现并给出真实证据;live 端我这台机器因判定器限流 fail-closed 而没能跑通完整 RCE,如实标注。文末给出真正有用的缓解手段。

阅读实测报告
Claude Code v2.1.241✅ 可复现实测于 2026-08-29

抓包拆开 Claude Code auto 模式的判定器:11 万字系统提示词逐段解析

上一篇复测确认了 auto 模式在放行 Bash 前会调一次会话模型当判定器,但那个判定器收到的到底是什么,一直是黑盒。这次我用本地日志代理把判定请求整包抓了下来:一份 116,879 字符的系统提示词,开头写着 You are a security monitor for autonomous AI coding agents。本文逐段引用抓包原文,拆开它的威胁模型、两级规则(1 条 HARD BLOCK / 68 条 SOFT BLOCK / 17 条 ALLOW)和两阶段判定流程——第一阶段只评估危害、明确不看用户意图,第二阶段才叠加意图和豁免。附三张真实终端截图和抓包证据,所有数字均来自本次读出,未经估计。

阅读实测报告
Claude Code v2.1.223🔍 未复现实测于 2026-08-06

claude install 断链、%h 未展开?Debian 容器实测装出来是好的(未复现)

GitHub 上有 Fedora 用户报告:官方一键安装脚本装完后 ~/.local/bin/claude 是条断链,指向字面量 %h/.local/share/claude/versions/2.1.220——%h 这个占位符没被展开成家目录。我们在干净的 Debian 12 容器里按原报告的完整命令实测,装出来的符号链接是正常的(%h 已正确展开),且当前 install.sh 分发的版本已是 2.1.223(报告版本为 2.1.220)。本文是一篇「未复现实录」:完整给出实测环境、命令与输出证据,分析未复现的三种可能解释,并附上如果你正被断链卡住的一分钟手工修复。

阅读实测报告
Claude Code v2.1.220✅ 可复现实测于 2026-08-06

Claude Code 报 No conversation found to continue:你的 -p 会话被交互模式过滤掉了

用 claude -p 跑完一条无头命令,接着敲 claude --continue 想进交互模式续聊,得到的却是 No conversation found to continue——但会话文件明明就在磁盘上。这是 v2.1.90 引入的回归:--resume 选择器'不展示 -p/SDK 会话'的过滤逻辑,误伤了本应无条件继续最近会话的 --continue。本文在 macOS + v2.1.220 上完整复现(GitHub issue 报告的是 Fedora,两平台坐实),给出两条实测可用的绕行:无头续聊 -p --continue 一直是通的;交互模式用 CLAUDE_CODE_ENTRYPOINT=sdk-cli 前缀可以绕过过滤、完整加载历史。

阅读实测报告
Claude Code v2.1.220✅ 可复现实测于 2026-08-06

Claude Code 到底在用哪个模型?settings.json、环境变量、--model 的优先级实测

多智能体、CI、批量脚本都依赖一个前提:会话真的跑在你配置的模型上。但模型可以在四个地方指定——settings.json、ANTHROPIC_MODEL 环境变量、--model 参数、会话内 /model——文档没有一张表告诉你谁覆盖谁,GitHub 上还有 Windows 用户报告 settings.json 配置被静默忽略、一整天的任务跑错模型全部作废。本文用 modelUsage 铁证逐层实测出优先级链:--model > ANTHROPIC_MODEL > 项目 settings.json > 内置默认,[1m] 后缀写法同样生效;并给出一个比任何 UI 提示都可靠的验证手段。

阅读实测报告
Claude Code v2.1.220✅ 可复现实测于 2026-08-05

Claude Code Hooks 的 stdin 陷阱:python heredoc 会吃掉你的 hook JSON

官方文档说 hook 通过 stdin 接收 JSON 输入,这没错。但如果你在 hook 脚本里用 python heredoc(python3 - <<'EOF')来解析这份 JSON,会掉进一个静默失败的坑:heredoc 把 python 的 stdin 重定向成了脚本本身,json.load(sys.stdin) 读到的永远是空。更糟的是,按最佳实践写的 hook 会吞掉一切异常静默退出——你不会看到任何报错,只会发现 hook '好像没生效'。这篇记录真实踩坑过程、两行代码的修复方案,和一个通用教训:静默容错的代码,调试时是你自己的敌人。

阅读实测报告
Claude Code v2.1.220✅ 可复现实测于 2026-07-28

Claude Code 的 auto 模式是用模型审模型的——模型一挂,连 cat 都跑不了

auto 权限模式在放行 Bash 前会额外调用一次当前会话模型,来判定这条命令安不安全——判定器和干活的是同一个模型。模型一旦不可用,你会撞进一个反直觉的半瘫状态:读文件、搜代码全都正常,但一条 cat 都跑不了。这篇文章记录了一次真实排查:我先后提出三个听起来都很合理的假设,又用对照实验把它们逐个推翻,最后只剩下一条真正可靠的退路。2026-08-29 在 v2.1.241 上用本地日志代理复测:坑被官方修掉了一半——常规读写命令不再过判定器,但判定器本体、会话模型绑定和 fail-closed 机制都还在,文末附抓包证据和确定性熔断实验。

阅读实测报告