工具大全
返回情报列表

码农早餐 · 2026-10-10

今日头菜:LiteLLM 换 Rust 内核:一个网关接 100+ 家 LLM,8ms P95 是怎么算出来的。另有 4 条快讯:1500 行代码拆成 10 个子任务,Agent 还是一个一个做;一个 Swift 二进制:让 Agent 在 macOS 屏幕上画箭头;等。

2026年10月10日11 分钟阅读码农早餐

LiteLLM 把内核换成了 Rust,Python 那层 import litellm 和 completion(model="openai/gpt-4o", ...) 一行都不用改,底下跑的已经是另一套东西。那个「8ms P95、1k RPS」我第一反应是先去点 benchmarks——网关自己算得快,不等于你从上海调到某家 provider 也快。

🍳 今日头菜当天唯一一条深度解读

LiteLLM 换 Rust 内核:一个网关接 100+ 家 LLM,8ms P95 是怎么算出来的

LiteLLM 的 README 现在写着「The fastest, litest AI Gateway. Rust core with Python SDK」。核心换了 Rust,外面还是那个 import litellm 的 Python API——你原来写的 completion(model="openai/gpt-4o", ...) 一行不用改,底下跑的东西已经不是同一套了。它要解决的问题没变:100+ 家 LLM provider,每家的 SDK、鉴权、请求格式、错误类型都不一样,LiteLLM 把它们统一成 OpenAI 格式,你可以当 Python SDK 直接嵌进代码,也可以把 Proxy Server 部署成团队级的 AI Gateway,虚拟 key、花费追踪、guardrails、负载均衡、日志、admin dashboard 都是开箱的。

最该盯着看的数字是那个「8ms P95 latency at 1k RPS」——它旁边挂着 benchmarks 链接,但延迟永远取决于你在什么硬件上、代理到哪家 provider、网络在哪一跳。 网关自己算得快,不代表你从上海调到 Bedrock 上某个模型只有 8ms。这个数字对得上场景才有意义,对不上就只是一句宣传。

LiteLLM 换 Rust 内核:一个网关接 100+ 家 LLM,8ms P95 是怎么算出来的

真正影响你的是分发方式变了。README 里多了一个独立的 litellm-core 发行版:同样的 import litellm API、同样的运行时依赖,但没有 optional extras、没有 CLI 入口、不打包 dashboard。同一个环境里 litellm 和 litellm-core 只能装一个,因为两者拥有重叠的 Python 文件。 要 proxy、CLI 和可选依赖就用 litellm;只要 SDK 就装 core。而 core 的发布集成还在路上,现在得从仓库里自己构建:python scripts/build_core_distribution.py --out-dir dist/core,再 pip install dist/core/litellm_core-*.whl。构建机需要 Git、uv 和 Rust 工具链——也就是说,一个纯 Python 项目现在要装 Rust 才能从源码出包。版本号从根 pyproject.toml 读,构建不改源文件,产出 wheel 和一个自包含的 sdist。

网关这类中间件从 Python 挪到 Rust,逻辑上说得通:它是所有请求的必经之路,多一跳就多一份延迟,用编译型语言换吞吐是常规操作。但代价也常规——构建链变长、二进制分发变复杂、出问题时你能读的栈从 Python 变成了 Rust。换内核这件事,收益在压测报告里,成本在你下次 CI 失败的时候。

💡 主厨说:那个 litellm-core 的发布集成 README 里写着「pending」,所以现在装 core 得自己跑构建脚本;等它正式发到 PyPI 上,这个手动步骤才会消失。

来源:

🍲 今日硬菜 · 2 条深读

1500 行代码拆成 10 个子任务,Agent 还是一个一个做

有人把 coding agent 的毛病写成了一篇长文,Hacker News 上讨论得很热闹。作者的核心判断是:模型在进步,agent 没跟上,瓶颈在 agent 这一层。他举的例子很具体——给一个开源文件分享应用加「用口令保护链接」的功能,总共约 1.5k 行新代码,OpenCode 很听话地把任务拆成 10 个子任务,然后老老实实一个一个做。

这就是最扎眼的地方:这 10 个子任务彼此独立,属于典型的 embarrassingly parallel,一台机器能同时开几十个进程、切换上下文比人快几百万倍,结果它排队做。Claude Code 好一点,会起一两个 subagent,但也要等它们全跑完才往下走;作者说一天里会好几次看着它干等端到端测试跑完,测试通过了才想起来「哦,我该看看 git 历史学一下你的 commit message 习惯了」。

另外两个问题更值得你留意。一是不会分派:需要扫 5 万行代码找某个模式时,agent 不会说「这活换个便宜快的模型就行」,也不会说「这题太难,换个聪明的上」,它只会拿最贵的模型硬啃,而 95% 的活都是体力活。二是它不认识自己:问 Claude 怎么用 Claude 的功能,它得联网搜,还不核对版本号,但为了一个你从没用过的功能默默下 13 GB 文件却毫不心疼——装包时省下 50 KB 的说明文档,代价是每次现搜。

对每天在用这些工具的人来说,结论不是「别用」,而是别指望它替你管任务。拆分、排序、选模型这些事,短期内还得你自己扛;把 prompt 写清楚、把任务切到足够小、在合适的子任务上手动换便宜模型,是现在能立刻省下时间和账单的三个动作。Agent 会变好,但在它学会自己分派之前,你的手别离开方向盘。

来源:

一个 Swift 二进制:让 Agent 在 macOS 屏幕上画箭头

Agent 能重构 monorepo、能写数据库迁移、能给你讲清楚 monad,可一旦需要你点一下「允许」按钮,它只能往一个你根本没在看的终端里打印一句 please click Allow in the dialog。这个落差,就是 bigarrow 想填的那一厘米。

它是一个 macOS 命令行工具,外加一个给 Claude Code 和 Codex 用的 skill,核心就三件事:在任意窗口之上画箭头、画方框、写大字。点击穿透,键盘焦点不动,事情办完箭头自己消失。MIT 协议,单个 Swift 二进制,没有 daemon、没有菜单栏图标、不用登录、不带 telemetry——作者还特意检查了两遍,确认里面没有 AI,它就是一支箭头。

干货在这里:画东西不需要任何 macOS 权限。它用一个透明窗口盖在所有 display 和所有 Space 之上,所以不用你去系统设置里开辅助功能授权——这一点挺关键,权限申请本身往往就是它要帮你解决的那个问题。定位元素靠 --element 加 --app,还能指定 --role(button、radiobutton 之类),样式上有 --style ring/box、--shape zigzag、--color、--size,方向 --from right/bottom-right/top,甚至能挂一个关闭按钮。README 里的例子很实在:六支箭头教会你怎么关掉「点壁纸显示桌面」,一支绿色箭头指着 Terminal 的开关,三步把 Keynote 的动画流程走完,还有一支粉箭头帮妈妈在打印对话框里找到「存储为 PDF」——旁边配一支小的黑箭头指着「取消」,写着 Not this one, Mom。

对写代码的人来说,这东西的价值不在箭头本身,而在它把「人机协作里最尴尬的一段」变成了可编程的。你在跑一个需要人工确认的 pipeline,Agent 卡在授权弹窗上,以前只能靠你在终端里刷日志,现在它能直接指给你看。代价也清楚:目前是 macOS 独占,Linux 和 Windows 上这套透明窗口加点击穿透的玩法得重写;元素定位依赖 accessibility 信息,界面一改版就可能指到空气上。所以别指望它进生产流程,它更适合当本地开发时的一根手指——毕竟让 Agent 学会指,比让它学会替你点,安全得多。

来源:

🥢 配菜 · 另外 2 条

微软开源 MXC:给 AI 生成的代码套上沙箱

AI 帮你写的代码,你敢直接跑吗?微软把 MXC 开源了,一个跨 Windows、Linux、macOS 的沙箱执行系统,专门跑不可信代码——模型输出、插件、工具都算。它提供 ProcessContainer、Windows Sandbox、LXC、Bubblewrap、Seatbelt、MicroVM 等多套隔离后端,用 JSON 配置文件和网络策略,还配了 Rust、.NET、Node 三套 SDK。其中 Windows Sandbox、MicroVM、Hyperlight 标注为实验性。对天天让 Agent 自己执行代码的你来说,这东西解决的正是「跑之前先关进笼子」的问题。不过沙箱不是万能锁,策略配错照样漏,先想清楚要隔离什么再选后端。

来源:

Anthropic 将定期公布 Claude 行为问题:首份报告列了四类

Anthropic 说要开始更频繁地发布模型行为报告,范围超出系统卡和常规风险报告。今天这份第一版,写的是他们在评测和内部使用中识别出的四类行为,每一类里 Claude 都「acted on real」——原文到这里就断了,具体是哪四类、后果是什么,没展开。

这条值得留意的地方在于发布方的姿态:从管用户怎么用,转向主动交代模型自己会干什么。一个模型厂商愿意把自家模型的行为问题定期摆到台面上,比只发能力榜单要有信息量。但四类行为只给了个开头,判断只能等报告全文。我的一贯看法是,模型行为的上限由数据决定,不由宣传决定,这类报告的价值全在细节里。

来源:


网关这层换 Rust,你手头那套 LiteLLM 是原地升上去,还是先拿一个非核心服务试水?明早 8 点见。

本期从过去 24h 的 X / Hacker News / GitHub Trending 共 53 条信息中挑出 5 条(全天逐小时采写、经事实校对后于晨间选编)。内容由 LLM 辅助生成,每条均附原始来源链接,重要决策请交叉验证。

码农早餐公众号二维码

微信扫码关注「码农早餐」

每天早 8 点推送到微信,不用记网址。关注后回复「价格」,拿大模型价格与退役时间速查表。

喜欢这篇?订阅每日推送

每天 8:00 精选 AI 编程动态,每周六另附一封亲手实测的周刊。

本页内容由 LLM 自动聚合 + 解读生成,每条均有原始来源链接,建议交叉验证。

码农早餐 · LiteLLM 换 Rust 内核:一个网关接 100+ 家 LLM,8ms P95 是怎么算出来的 | Magic Tools | Magic Tools