工具大全
开发者工具作者:Coocon2026年8月16日143 次阅读约 11 分钟阅读

232 倍提速与 99.9% 水印同一天落地:AI 写代码,神话和规则一起敲门

232 倍提速与 99.9% 水印同一天落地:AI 写代码,神话和规则一起敲门

昨天两件事同时发生。一个叫 Sankalp 的开发者用 Codex 把 kernel 提速了 232 倍,在 GPU Mode 的 183 人竞赛里排第 12。同一时间,Anthropic 发文说未来的 Claude 会给生成的每一段文字打水印,检测准确率 99.9%。

一个在讲能力,一个在讲规则。很多人只盯着 232 倍这个数字,觉得「AI 马上要替代性能工程师了」。也有人盯着水印,担心「以后 AI 写的东西藏不住了」。两个反应都偏了。

232 倍不是常态,是上限

先说清楚 232 倍怎么来的。GPU Mode 办了一场「自动研究」主题的竞赛,题目是批量 Householder QR 分解——一个线性代数 kernel。Sankalp 让 Codex 反复做实验、找瓶颈、改代码、跑测试,14 天提交了 1500 多次。最后在 512×512 到 4096×4096 的矩阵上,比 baseline 快了 232 倍。

数字是真的,但它是上限,不是均值。QR 分解是个被研究了几十年的老问题,优化空间早就被摸透了。换句话说,baseline 本身很可能就慢,随便一个合理的 blocked 算法都能翻几十倍。换到你自己的项目,很可能连 2 倍都挤不出来。

这就像看百米纪录 9 秒 58,然后觉得自己也应该跑进 10 秒。纪录是真的,但它不描述普通人的日常。

真正值钱的不是 232,是那个闭环

Sankalp 最有意思的一句话,是他管这套叫「loop engineering」——循环工程。GPU Mode 给选手提供了 popcorn CLI,agent 能直接在上面跑测试、看 benchmark、提交到排行榜,不用手动搭环境。

这意味着 profiling(定位热点)→ patch(改代码)→ verify(验证效果)这个闭环,第一次可以半自动地交给 AI 跑。十年前做 kernel 优化,工程师得手动跑 perf、看汇编、重新编译,反复磨。现在这个循环被压缩了。

232 倍你复现不了,但闭环你明天就能搭。哪怕它只让你的某个函数快 20%,这个能力也是实打实属于你的。

水印那边:AI 文本开始「可追溯」了

再看 Anthropic 的水印。原理不难懂:模型生成每个词时,都会在几个意思差不多的候选词里随机选一个。水印不改变这些词的意思,只改变「随机」的来源——用一个密钥加前文来决定选哪个词,而不是用普通的随机数。

对读者来说,加水印和不加水印的文本没区别;对持有密钥的人来说,他能算出一段文本「大概率是 Claude 写的」。准确率 99.9%,误报率不到 0.01%。

有两点容易被忽略。这不是 Anthropic 一家在单干——8 月 2 日起,欧盟 AI 法案要求服务欧盟市场的 AI 供应商标记 AI 生成内容,几家大厂签的是同一份行为准则。另外,水印不带任何身份信息,查不出「是谁、哪次对话」生成的,只能判断「是不是 AI 写的」。

这跟你有啥关系

如果你是做内容平台的,水印给你递了个新工具。审核、反作弊、版权判断,以前靠「感觉像 AI」,现在可能有个检测 API 能兜底。该去看看 Anthropic 官网的检测能力开不开放。

如果你是调 Claude API 的开发者,得知道一件事:你的输出可能被第三方识别成「AI 生成」。这在某些场景是好事(标注透明),在另一些场景是麻烦(比如有些平台会限流或降权 AI 内容)。

今天你可以做的

别光顾着转发「232 倍」的标题。挑一个你自己项目里最慢的函数,让 Codex(或任何能跑代码的 agent)做三轮 profiling → patch → verify 的循环,看它到底能快多少。这个数字才是你的,其他都是别人的纪录。

至于水印,去 Anthropic 官网看一眼检测 API 开没开,把它记进你的合规清单。能力是上限,规则是底线,中间那块能跑起来的闭环,才是你今天该动的。

参考:

✨ 本文由 DeepSeek 生成初稿,Claude 审核润色。

相关文章

码农早餐 · 2026-09-30

今日头菜:Anthropic 招股书:营收翻 12 倍,亏了 420 亿。另有 4 条快讯:0.8B 模型在家训完:254 个选项里选一个,28 毫秒;7 块 ESP32-S3 串成一条链,跑起 0.5B 的 1.58-bit 模型;等。

daily-intel2026年9月30日11 min
20
Claude Code 安装失败实测:npm EACCES、镜像卡 600 秒、Node 20 静默装旧版、install.sh 返回地区拦截页、原生安装器顺手卸掉 npm 版——15 条报错原文与解法

Claude Code 安装失败实测:npm EACCES、镜像卡 600 秒、Node 20 静默装旧版、install.sh 返回地区拦截页、原生安装器顺手卸掉 npm 版——15 条报错原文与解法

在 macOS 上把 claude code 安装的失败面逐个真实复现,共 15 条报错原文,全部带墙钟和 exit code。npm 全局装到 /usr/local:EACCES,exit 243。cache 目录只是 0555,npm 却报 root-owned 并建议 sudo chown。本机 npmmirror 两次分别用了 147 秒、超过 600 秒,官方源两次都在 11–12 秒(仅 2 个样本)。Node 20 不钉版本号会静默装到 2.1.197,没有任何警告。境内直连 claude.ai/install.sh 时 curl exit 0,拿到的却是一张 447KB 的地区拦截页 HTML。原生安装器会调用 npm uninstall -g,把已有的 npm 版删掉,终端里不提示——本次实测真的删掉了本机的全局安装。

claude-codenodejs+6
pitfalls2026年9月29日11 min
39

码农早餐 · 2026-09-29

今日头菜:一句「不要猜」,编造率从 71% 掉到 20%。另有 4 条快讯:Go 的 import 路径绑死在 GitHub:换一次托管要动多少代码;Sonnet 5.5 发布:Terminal-Bench 从 10.3% 跳到 70.6%;等。

daily-intel2026年9月29日10 min
52
DeepSeek harness 实测:同一个模型换三种外壳——Claude Code 15/15、Codex CLI 15/15、裸 API 0/15 还谎报 5 次完成

DeepSeek harness 实测:同一个模型换三种外壳——Claude Code 15/15、Codex CLI 15/15、裸 API 0/15 还谎报 5 次完成

同一个 deepseek-v4-pro,三种 harness,读 / 写 / 改 / 跑命令 / 多步五个任务各 3 轮,副作用一律落盘核验。Claude Code 走 DeepSeek 的 Anthropic 端点:15/15,中位 4.17 秒,每轮 ¥0.159。Codex CLI 0.157.1 走 Responses 端点:15/15,中位 15.52 秒,每轮 ¥0.022——只有前者的 1/7。裸 chat/completions:0/15,其中 5 轮回复 DONE / EDITED,磁盘上什么都没有。差异全在 harness 不在模型:DeepSeek 的 Anthropic 端点按 metadata.user_id 分区缓存,Claude Code 每次 claude -p 都冷启动、约 15K token 全价;Codex 根本没有文件工具,读写改全走 shell;注入 500 时 Claude Code 重试 10 次约 175 秒、Codex 30 次约 25 秒放弃,429 时 Codex 不重试;120KB 输出时 Claude Code 只给模型看头部 2KB,Codex 保留头尾。另:Codex 0.157.1 已移除 wire_api = "chat",DeepSeek 必须走 responses。

claude-codedeepseek+6
hands-on2026年9月28日12 min
93