AI 教程
AI 工具与工作流实战教程——覆盖 ChatGPT、Claude、Gemini、AI 绘图与日常自动化。每篇都是从配置到出结果的分步指南,附截图与可直接复用的示例。
📚 Claude 教程合集
40+ 篇英文 Claude 教程:Prompt 工程、Claude Code、API、Agents…按主题分组导航 →
加载中...
AI 工具与工作流实战教程——覆盖 ChatGPT、Claude、Gemini、AI 绘图与日常自动化。每篇都是从配置到出结果的分步指南,附截图与可直接复用的示例。
📚 Claude 教程合集
40+ 篇英文 Claude 教程:Prompt 工程、Claude Code、API、Agents…按主题分组导航 →
加载中...
一台 24GB 统一内存的 Mac mini 到底能跑什么模型?答案是:27B 的 4-bit 量化就是天花板,且我们真的把 Qwen3.8-27B 在 M4 丐版上完整跑通了——峰值内存 19.4GB,投机解码后 11.7-12.2 tok/s。本文汇总这台机器上的全部实测:各参数量级的内存账、速度预期、三条提速路线的真实效果(DFlash 2 / 原生 MTP / MLX vs llama.cpp),以及量化档位怎么选。
4-bit 量化会让模型变笨吗?Q3 还能不能用?本文基于 llama.cpp 官方对 Llama-3-8B 全量化档位的 PPL/KLD 实测数据,把 Q8_0 到 IQ1_S 每一档的精度损失讲清楚,给出'内存装得下的前提下选最高档'的具体选择路径,并回答 Q4 与 Q8 差多少、imatrix 有什么用、1.58-bit 是怎么回事等高频问题。
投机解码三部曲第三篇。llama.cpp 合并了 DFlash 2 支持、官方还发了配套 GGUF 草稿模型,理论上这是比外挂 MLX 更顺手的路线——实测结果是全配置净减速:官方推荐的 n-max 7 在 24G 机器上可复现 Metal OOM,能跑起来的 n-max 3 散文掉一半(6.0 → 3.0 tok/s),代码接受率高达 83.8% 也还亏 23%。同一个算法、同一台机器,MLX 栈是 1.8–1.9x。用真实数据算清一笔账:这条栈上每个投机步实测均摊 0.77 秒,就算接受率 100% 也追不回本。
上一篇 DFlash 2 实测结尾预告过的路线:Qwen3.8 自带训练好的 MTP 多 token 预测头,llama.cpp 已支持直接挂载,不需要额外 2B 草稿模型。这次在同一台 24G Mac mini M4 上把它跑通并与 DFlash 2 正面对照:内存确实更省(峰值 16.0GB vs 19.4GB),但速度是净减速——散文 6.0 → 4.5 tok/s(-24%),代码也没赚。同机 DFlash 2 是 1.8–1.9x 加速。差距不在草稿质量(接受率 59–85% 很健康),在 Metal 后端:batch 8 解码摊薄实测只有 1.13x,验证 3 行草稿的代价≈3 次完整前向,草稿再准也赚不回来。
8 月 24 日 Claude 多模型 API 故障全复盘:04:50–07:36 UTC 报错,Opus 5 / Fable 5 / Mythos 5 / Opus 4.8 受影响,claude.ai、Claude API、Claude Code、Claude Cowork 全中招。附状态页原话时间线和给开发者的建议。
DFlash 2 发布一周后,我在一台 24G 的 Mac mini M4 上把 Qwen3.8-27B 加投机解码完整跑通:4-bit 量化下从 6.5 tok/s 提到 11.7–12.2 tok/s,稳定 1.8–1.9 倍。这篇记录完整部署命令、三轮对照实测数据、24GB 的内存账,以及官方 2.7–3.4x 数字在消费级 Mac 上打折的三个具体原因。8-29 复测追加 block-size 与草稿精度扫描:block-size 8 崩到 1.11x 坐实官方悬崖警告,block-size 3 反超默认值,8-bit 草稿不如 4-bit。
看到 Diffusion 就想到画图,是这篇技术报告最容易被误读的地方。DiffusionGemma 生成的是文本——它一次并行精修 256 个 token 的块,单张 H100 上跑到约 1500 tokens/s。更值得注意的是它怎么来的:不是从零训练,而是拿 Gemma 4 的 MoE 模型微调,只花了原模型不到 10% 的训练 token 预算。
Go 1.27 于 2026 年 8 月发布,泛型方法正式写进语言规范——这是 2022 年 Go 1.18 引入泛型以来最大的语言层面变化。提案副标题直接叫「A change of view」,Go 团队罕见地公开推翻了自己写在官方 FAQ 里的结论。
Mojo 1.0 完全开源,编译器全部公开。但在这之前两个月,写它的人已经连同 150 人团队一起,被高通以近 40 亿美元买走了。
2026 年 8 月 19 日,默沙东与 Moderna 宣布个性化新抗原疗法 intismeran 联合 KEYTRUDA 的三期 INTerpath-001 达到主要终点。这是 mRNA 癌症疗法第一次拿到三期阳性结果,但它证明的和没证明的,需要分开看。
GPT-5.6 Sol 在 OpenRouter 上从 $5/$30 降到 $2.50/$15,「砍半」属实,但传播版本漏了三件事:这是 OpenRouter 和 Vercel AI Gateway 的平台侧促销,OpenAI 官方定价页至今仍是 $5/$30;促销 9 月 18 日到期;自带 key(BYOK)的请求不享受。SemiAnalysis 还提出了一个更尖的质疑——这两个平台占 OpenAI 用量微不足道,却恰好是外界估算模型市场份额的主要公开数据源。本文给出 17 个模型同口径价格表、272K 长上下文的加价陷阱,以及一份「要不要切」的决策清单。
Anthropic 让 Claude 独立跑完一次真实的蛋白质结合剂设计战役:15 个靶点成功 14 个,命中率 22%–35%,是行业典型水平的两倍以上,并由两家独立湿实验室验证。更关键的是,那份约 3 万 token 的提示词和全部实验数据被完整开源。