官测 Terminal-Bench 87.9 只差 Fable 5 零点一分,实测 Artificial Analysis 综合却仅 53 分,当天下午公告即被撤下。扒开 Hugging Face 提交记录与 API 指纹,这是一次配置错位的发布事故,而非模型翻车。
Netlify 用开源评测框架 AXIS,把同一个建站提示词喂给 11 个主流模型,credit 消耗从 2.4 到 519。这是一份关于模型选型的一手实证,也是一份关于「贵到底值不值」的账单。
Kimi K3 权重上架、Dario 发否认信之后的第一个工作日,HN 头版没有继续吵政策,而是摆出了两本账:一家立陶宛团队花 500 美元 GPU 时间,用 GRPO 把一个 9B 开源模型在电商目录审核任务上训到 87.3%,打赢了包括 GPT-5.5、Gemini 3.1 Pro、Claude Fable 5 在内的全部五个前沿配置,单价便宜 68 倍;另一边,一位 Modal 工程师写下「用开源模型感觉出奇地好」拿了 303 分。本文核实实验细节、如实列出评论区的三记重锤(自建基准自训自评、500 美元只是最便宜的账单项、Ramp 营收数据的归因谬误),以及这两篇各自的利益相关。
DeepSeek创始人梁文锋在4小时投资人交流会中,系统阐述了公司的初心、开源战略、API定价逻辑、AGI技术路线、组织管理哲学、算力差距认知、国产替代路线等核心议题。本文提炼10个核心观点,带你读懂这家中国AI公司的底层思维。