232 倍提速与 99.9% 水印同一天落地:AI 写代码,神话和规则一起敲门
232 倍提速与 99.9% 水印同一天落地:AI 写代码,神话和规则一起敲门
昨天两件事同时发生。一个叫 Sankalp 的开发者用 Codex 把 kernel 提速了 232 倍,在 GPU Mode 的 183 人竞赛里排第 12。同一时间,Anthropic 发文说未来的 Claude 会给生成的每一段文字打水印,检测准确率 99.9%。
一个在讲能力,一个在讲规则。很多人只盯着 232 倍这个数字,觉得「AI 马上要替代性能工程师了」。也有人盯着水印,担心「以后 AI 写的东西藏不住了」。两个反应都偏了。
232 倍不是常态,是上限
先说清楚 232 倍怎么来的。GPU Mode 办了一场「自动研究」主题的竞赛,题目是批量 Householder QR 分解——一个线性代数 kernel。Sankalp 让 Codex 反复做实验、找瓶颈、改代码、跑测试,14 天提交了 1500 多次。最后在 512×512 到 4096×4096 的矩阵上,比 baseline 快了 232 倍。
数字是真的,但它是上限,不是均值。QR 分解是个被研究了几十年的老问题,优化空间早就被摸透了。换句话说,baseline 本身很可能就慢,随便一个合理的 blocked 算法都能翻几十倍。换到你自己的项目,很可能连 2 倍都挤不出来。
这就像看百米纪录 9 秒 58,然后觉得自己也应该跑进 10 秒。纪录是真的,但它不描述普通人的日常。
真正值钱的不是 232,是那个闭环
Sankalp 最有意思的一句话,是他管这套叫「loop engineering」——循环工程。GPU Mode 给选手提供了 popcorn CLI,agent 能直接在上面跑测试、看 benchmark、提交到排行榜,不用手动搭环境。
这意味着 profiling(定位热点)→ patch(改代码)→ verify(验证效果)这个闭环,第一次可以半自动地交给 AI 跑。十年前做 kernel 优化,工程师得手动跑 perf、看汇编、重新编译,反复磨。现在这个循环被压缩了。
232 倍你复现不了,但闭环你明天就能搭。哪怕它只让你的某个函数快 20%,这个能力也是实打实属于你的。
水印那边:AI 文本开始「可追溯」了
再看 Anthropic 的水印。原理不难懂:模型生成每个词时,都会在几个意思差不多的候选词里随机选一个。水印不改变这些词的意思,只改变「随机」的来源——用一个密钥加前文来决定选哪个词,而不是用普通的随机数。
对读者来说,加水印和不加水印的文本没区别;对持有密钥的人来说,他能算出一段文本「大概率是 Claude 写的」。准确率 99.9%,误报率不到 0.01%。
有两点容易被忽略。这不是 Anthropic 一家在单干——8 月 2 日起,欧盟 AI 法案要求服务欧盟市场的 AI 供应商标记 AI 生成内容,几家大厂签的是同一份行为准则。另外,水印不带任何身份信息,查不出「是谁、哪次对话」生成的,只能判断「是不是 AI 写的」。
这跟你有啥关系
如果你是做内容平台的,水印给你递了个新工具。审核、反作弊、版权判断,以前靠「感觉像 AI」,现在可能有个检测 API 能兜底。该去看看 Anthropic 官网的检测能力开不开放。
如果你是调 Claude API 的开发者,得知道一件事:你的输出可能被第三方识别成「AI 生成」。这在某些场景是好事(标注透明),在另一些场景是麻烦(比如有些平台会限流或降权 AI 内容)。
今天你可以做的
别光顾着转发「232 倍」的标题。挑一个你自己项目里最慢的函数,让 Codex(或任何能跑代码的 agent)做三轮 profiling → patch → verify 的循环,看它到底能快多少。这个数字才是你的,其他都是别人的纪录。
至于水印,去 Anthropic 官网看一眼检测 API 开没开,把它记进你的合规清单。能力是上限,规则是底线,中间那块能跑起来的闭环,才是你今天该动的。
参考:
- How I achieved a 232x Faster Kernel – sankalp's blog
- How Claude's text watermarking works – Anthropic
- GPU Mode: Linear Algebra Kernels in the Age of Research
✨ 本文由 DeepSeek 生成初稿,Claude 审核润色。