工具大全
ai-tutorials2026年7月28日11 次阅读约 9 分钟阅读

Kimi K3 权重踩线上架,同一天 Anthropic CEO 亲自发文否认「想禁开源」

Kimi K3 权重踩线上架,同一天 Anthropic CEO 亲自发文否认「想禁开源」

先把上一篇的悬念收掉。

两天前我在《三个时钟》里记录过:截至 7 月 27 日 01:08 UTC,Hugging Face 上 moonshotai 的 K3 仓库还不存在,而 Moonshot 自己的措辞是权重将在「7 月 27 日之前」(by July 27)放出——所以当时还谈不上违约,他们还剩 23 个小时。

结果是:Moonshot 踩线交付了。

7 月 27 日当天,moonshotai/Kimi-K3 仓库上线,HN 帖子冲到 1314 分、516 条评论,是那两天全站第一。评论区有人挂了个倒计时页面等开闸,像守跨年。

然后,同一天,另一件事发生了:Dario Amodei 在 Anthropic 官网发表了一篇亲笔署名的立场文,标题是《Our position on open-weights models》(我们对开放权重模型的立场)。文章第一段就直奔主题:

「Anthropic 从未主张禁止开放权重模型。」

一家以安全立场著称的头部实验室 CEO,在史上最大开源权重发布的当天,亲自出来发否认信——这两件事放在一起,就是这个周末 AI 行业的全部剧情。

这篇文章做两件事:先核实 K3 这次发布到底放出了什么、怎么读它的评测表;再逐条转述 Dario 实际说了什么、以及 HN 的 665 条评论为什么大面积不买账。

一、权重真的落地了:你拿到的是什么

从模型卡和技术报告看,这次放出的不只是一个权重文件:

  • 规模:2.8 万亿总参数、104B 激活参数的 MoE,896 个专家每 token 选 16 个(外加 2 个共享专家)。官方称之为「世界上第一个开源 3T 级模型」。
  • 架构:93 层里 69 层用 Kimi Delta Attention(KDA)、24 层用门控 MLA,配上 Attention Residuals;原生多模态(4.01 亿参数的 MoonViT-V2 视觉编码器),上下文窗口 100 万 token。
  • 精度:MXFP4 权重 / MXFP8 激活,而且是量化感知训练(QAT)的原生产物——不是发布后再压的。整包下载约 1.5TB。
  • 配套 infra 同步开源:MoonEP(专家并行)、FlashKDA(KDA 内核)、AgentEnv(agent 环境)。《三个时钟》里提过 KDA 与常规 prefix caching 不兼容、「配套推理代码没就位就发权重等于发一个跑不起来的文件」——这次他们把配套一起发了。

许可证有一个不是 MIT 的地方,值得原文核对:如果你用 K3 经营模型即服务(MaaS)业务,且任意连续 12 个月总收入超过 2000 万美元,需要与 Moonshot 另签协议;月活超 1 亿或商业产品收入超 2000 万美元的,需在产品中标注「Kimi」。对绝大多数研究者和中小团队没有影响,但托管商不能装作没看见这条。

至于「开源了人人都能跑」——不存在的。MXFP4 原生也意味着约 1.5TB 显存起步,HN 上有算力从业者估算:8 张 B200 是理论下限,考虑上下文和吞吐,现实配置是 16 张。这份权重的直接受益者是托管商和云厂商,不是你的工作站。

二、评测表怎么读:赢在哪、输在哪、脚注里藏着什么

模型卡给出了一张几十行的对比表,对家是 Claude Fable 5、GPT-5.6 Sol、Claude Opus 4.8、GPT-5.5 和 GLM-5.2。延续《四个被误读的数字》的习惯,先看脚注再看数字。

K3 明确赢的:BrowseComp 91.2(对 Fable 5 的 88.0)、MCPMark-Verified 94.5(对 87.4)、OmniDocBench 91.1、τ³-Banking 33.4。最扎眼的是 SWE-Marathon 42.0,对 Fable 5 的 35.0——就是《关灯软件工厂》里提到的那个约 400 小时长任务、复合奖励的基准。如果这个分数站得住,它恰好回应了「开源模型只会刷短任务」的质疑。

K3 明确输的:FrontierSWE 81.2 对 Fable 5 的 86.6,GDPval-AA v2 的 Elo 1686 对 1747,OSWorld 2.0 落后约 8 分。真实工程长尾和通用电脑操作上,闭源第一名仍然领先。

脚注里的条件:K3 的编码类分数是用自家 Kimi Code harness 跑的,而对家取的是「各自最优 harness」的成绩——比如 Terminal-Bench 上 Claude 用 Terminus 2、GPT 用 Codex。脚注同时给了参照:换成中立的 mini-SWE-agent harness,K3 在 DeepSWE 上是 67.3,和自家 harness 的 67.5 几乎没差。这个诚实度值得认可,但结论仍然要带条件说:「开源模型第一次进入第一梯队」成立;「开源模型全面追平闭源第一名」不成立。

三、同一天的另一封信:Dario 实际说了什么

现在看 Anthropic 那边。先交代背景:过去一周,有报道称美国官员在考虑禁止美国公司使用中国开源模型;随后英伟达、微软等多家公司签署公开信反对(背景见《开源 AI 的 Kubernetes 时刻》);舆论场上有人指控 Anthropic 是禁令的幕后推手,动机是保护自家生意。

Dario 的回应文值得忠实转述,因为它比双方阵营的漫画版都更微妙。他的立场分三层:

第一层,明确反对禁令。「不具备危险能力的开放权重模型是公共品」,禁止美国企业使用它们「无助于解决我最严重的国家安全关切」,「保护美国 AI 公司免于竞争从来不是我的目标」。注意:这对开源阵营其实是一次助攻——正在酝酿禁令的是华盛顿的官员,而行业里被指控推动禁令的公司刚刚公开把自己从禁令阵营里摘了出去。

**第二层,两个「噩梦场景」。**其一,威权政府(他点名中共是「最有能力的威胁」)造出比美国更强的模型用于军事优势和监控镇压——他强调这与权重开不开放无关,「最危险的模型可能是秘密训练、只交给军方的那个」。其二,强模型被滥用于网络攻击和生物攻击——开放权重在这点上风险确实更高,因为护栏可以被移除、权重放出后不可撤回。

第三层,三项具体主张:对华芯片与设备出口管制并打击走私;打击「工业级蒸馏行动」;对所有足够强的模型——开源闭源一视同仁——实施强制安全测试,且测试需要全球执行,「连中共也需要参与」。

四、HN 的 665 条评论为什么不买账

这篇否认信的评论区,是我近期见过对 Anthropic 敌意最浓的一次。把最有分量的质疑列出来,也把说得公道的辩护列出来。

**质疑一:「强制测试」就是禁令的执行机制。**得到最多展开讨论的评论来自 cogman10:「谁来主持这个测试?测试成本过高、或者主持方拒绝给某些人盖章怎么办?美国历史上就是这样禁掉商品的——先要求盖章,然后拒绝发章。」modeless 补了一刀:模型测试不通过会发生什么?Dario 通篇没有说后果是什么,「而如果他不肯说,很难想象那个后果不是禁令」。

**质疑二:蒸馏条款的双标。**多位评论者指出:Anthropic 的训练数据里有数百万本书(其中的争议官司刚过去一年),如今要求「打击工业级蒸馏」,听起来像「我们拿完了,请把梯子撤掉」。这条情绪浓度最高,但也要说明:Dario 文中对蒸馏的表述是它让中国前沿「逼近美国前沿几个月以内」,他反对的理由是国家竞争而非知识产权——评论区的类比在情感上成立,在论证上并不完全对位。

质疑三:芯片论的事实基础。「中国没有美国芯片就造不出更强的模型」这句话被 j_rosenberg 直接质疑——而 K3 恰好在同一天上架,这个时间点让这句话的说服力打了折扣。公平地说,K3 用什么芯片训练、算力从何而来,公开信息不足以下结论,两边在这点上都是断言。

**公道的辩护也存在。**arjie 的评论值得引用:「这是他在不违背自己已表达原则的前提下能采取的最大开放立场。如果你不想让生物武器级的模型开放权重,就不可能无条件支持开放。分歧只在于我们现在到没到那个程度。」Handy-Man 说得更简单:「立场对他们有利,不代表风险是编的。」

五、我的解读:辩论的坐标系在一天之内移动了

把这两件事放回一条时间线:7 月 21 日,北京被报道在起草权重出口管制;7 月 25 日,华盛顿被报道在考虑使用禁令、行业公开信发出;7 月 27 日,权重上架,否认信落地。

我的读法是三点:

**第一,「开源能不能摸到第一梯队」从预测变成了事实,辩论被迫升级。**上周的争论还是「该不该禁」;权重落地之后,任何禁令方案都要面对一个已经分发出去、不可撤回的 1.5TB 文件。值得玩味的是,「权重放出即不可撤回」这个事实,双方都在引用——Dario 把它列为风险(护栏可被移除、无法召回),开源阵营把它当作保障(没有任何政府能再把它收回去)。同一个物理事实,是风险还是保障,取决于你信任谁的手更稳。

**第二,下一场争夺战在「谁来发章」。**如果强制安全测试成为共识——Dario 说行业提案和白宫近期动向都在往这个方向走——那么真正的权力在测试的主持方和判定标准。cogman10 的「盖章禁令」担忧不是抬杠,是美国贸易史的常规操作。对开源阵营来说,接受测试框架的同时争夺测试的中立性,会比继续喊「不要监管」更重要。

**第三,对普通开发者,实际变化发生在价格表上。**K3 的托管成本(8–16 张 B200)会给「3T 级模型的每百万 token 到底该卖多少钱」第一次给出市场答案。HN 上有人给了参照:GLM-5.2 开源后一个半月,第三方托管价格被压低了约 45%(这个数字有争议——低价方跑的是更低精度的量化版,对比并不完全公平,参见《当 API token 卖到官方价的 3%》里讲过的道理:托管价格战里,你要同时问价格和精度)。如果你在做 agent 产品,接下来几周把 K3 的第三方托管报价和官方 API 摆在一起看,注意标注量化精度,那里会是这次发布最真实的落点。

最后补一个细节。Dario 那篇文章发出的同一天,还有另一条新闻在 HN 上拿了 256 分:《金融时报》报道 AI 公司在华盛顿的游说开支创下历史纪录。评论区有人说:作为诚意的证明,可以先把游说预算停两年。

这话刻薄,但提醒了一件事:立场文写得再清楚,行业对「谁在影响规则」的信任赤字,不是一篇博客能补上的。


参考链接

相关文章

劝美国别禁中国开源模型的人,正是当年被 Kubernetes 干掉的那个创始人

7 月 25 日,一篇《开放权重 AI 正在经历它的 Kubernetes 时刻》冲上 Hacker News 第三位,399 分、313 条评论。作者 Tobi Knaup 的身份是全文最重的一枚砝码:他就是当年被 Kubernetes 碾过去的 Mesosphere 联合创始人。本文拆解他的论证、类比失效的地方、华盛顿正在酝酿的『事实禁令』,以及为什么 7 月 27 日这个日期让一切变得紧迫。

大模型开源模型+6
ai-tutorials2026年7月27日8 min
80

三个时钟:Kimi K3 的权重为什么还没发出来

承诺的发布时点已过,Hugging Face 上 moonshotai 的最新仓库仍是上个月的 K2.7-Code。本文附我在 7 小时里对官方 API 的四次实测记录,但重点不是「迟到了」——而是这次发布同时被三个时钟牵制:Moonshot 的工程排期、北京正在起草的权重出口管制(关键在「已下载的不受影响」)、以及华盛顿的蒸馏指控与制裁威胁。开源权重的发布日期,第一次不再由训练进度决定。

开源模型kimi-k3+5
ai-tutorials2026年7月27日10 min
92

当 API token 卖到官方价的 3%,你买的就不是 token 了

425 元人民币换 3333 美元的 Anthropic 官方额度,折扣 97.8%。这不是促销,是一条四层产业链的末端价格。本文拆解「中转站」市场的完整结构——卡商、号池、中转站、买家,它跑在哪两个开源项目上,钱从哪来,以及最容易被产品团队忽略的一条:只要你的产品暴露了模型能力,你就已经是这条供应链的上游库存。

llmanthropic+6
ai-tutorials2026年7月27日13 min
83

Kimi K3 开权重前夜:四个被广泛误读的数字

2.8 万亿参数、51% 幻觉率、六项榜单第一、3.3 万亿美元市值蒸发——围绕 Kimi K3 传播最广的四个数字,每一个的通俗解读都是错的。本文逐个拆开分母、口径和因果链,附一份权重落地前的核查清单,以及我在 UTC 7 月 26 日 17:45 对 Hugging Face 官方仓库的实测状态。

大模型开源模型+6
ai-tutorials2026年7月27日10 min
71