工具大全
ai-tutorials2026年7月27日4 次阅读约 13 分钟阅读

当 API token 卖到官方价的 3%,你买的就不是 token 了

当 API token 卖到官方价的 3%,你买的就不是 token 了

先看一个价格。

某个中转站的比价页上挂着这样一个套餐:425 元人民币,换约 3333 美元的 Anthropic 官方额度。折算下来,你每花 1 美元,买到 7.7 美元的官方用量——每 1 美元官方用量只要 0.13 美元,折扣 97.8%。

这不是补贴,也不是团购。任何一个做过云服务成本的人看到这个数字都应该立刻警觉:**97.8% 的折扣不可能来自议价能力。**再大的渠道商,从上游拿到的批发价也不可能是零售价的 2%。

当一个商品的售价远低于它的成本,只有一个解释:**它不是商品。**它是别的东西的赠品,或者别的生意的诱饵。

这篇文章拆解这条产业链的四层结构、它跑在什么软件上、钱从哪来、以及——对大多数读者更重要的——如果你在做 AI 产品,你在这条链条里的位置在哪。

本文的一手材料来自安全研究者 Matt Lenhard 于 2026 年 6 月 28 日发表的威胁研究,其原始信源是 V2EX 一个从 3 月 5 日持续到 6 月 23 日、约 3.5 万阅读 190 回复的中文行业讨论帖。文中的实测数据为我本人核查。

这不是一群黑客,是一条供应链

外界谈这件事时习惯用「黑产」「盗刷」这种词,暗示的是零散的、机会主义的作案。实际结构比这工业化得多,分工清晰的四层

上游:卡商 / 号商。 卖两样东西——能通过美国和欧洲账单校验的虚拟信用卡,以及批量注册好的账号。这是原料层。

中游:账号池(账号池)。 把几十上百个上游账号聚合起来,统一管理鉴权 token 和速率限制,某个账号被风控标记时自动故障转移,对外暴露一个 API 接口。这是最关键的一层——它把「一堆随时会挂的脏账号」变成了「一个看起来稳定的服务」。

下游:中转站(中转站)。 把号池的接口包装成一个界面干净、能开发票、有微信客服群的中文产品,然后彼此拼价格。这是消费者看到的那一层。

末端:买家。 找便宜推理算力的个人开发者、初创公司、中型 SaaS,以及——用这套基础设施做模型蒸馏的商业买家。

实践中中游和下游经常是同一批人在做,论坛里「号池」和「中转站」两个词也常常混用。但这个四层结构说明了一件事:**这个市场已经过了草莽期。**它有比价网站,有联盟分佣,有网关产品,有客服 SLA。研究者跟踪的十家流量最高的中转站,合计月访问量 360 万次

它跑在两个正经的开源项目上

几乎所有中转站都建在同两个开源项目之一上:one-apinew-api

这两个都是 OpenAI 兼容网关。运营者部署好面板,加一组渠道,每个渠道 = 一个上游供应商 + 一池 API key。面板对外暴露一个和 OpenAI API 完全一致的端点,所以买家把现有 SDK 的 base_url 一改就能用。每次请求从池子里取一个 key、转发上游、返回结果,然后按用量乘以一个倍率扣配额。用户、令牌、价格档、日志、账单,全都现成。

**这里必须说清楚:这两个项目本身完全正当。**大量正规公司自建 one-api 来把自家的多个账号收在一个网关后面,做团队配额和成本归集——这正是它被设计出来的用途。

**越界发生在库存上,不在软件上。**当一个网关的渠道里塞的是被盗的、泄漏的、池化的 key 而不是运营者自己的账号,并且违反供应商条款转售这些访问权时,它才变成中转站。工具是中立的,进货渠道不是。

我顺手核查了这两个项目的现状,发现一个原文没有提到的细节:

项目 Stars 最后提交
songquanpeng/one-api 35,953 2026-01-09
QuantumNous/new-api 43,459 2026-07-26(当天)

原研究指出,在其跟踪的中转站里 one-api 出现的频率约是 new-api 的四倍。把这个观察和上表放在一起,结论就清楚了:**存量在 one-api,增量在 new-api。**one-api 的主仓已经停更七个月,但装机量还在惯性里;而 new-api 这个 fork——它比 one-api 多出来的东西恰恰是自助支付、充值和图像视频音频模型——星标已经反超,且在我核查当天仍有提交。

一个 fork 的差异化功能是「自助收银台」,这本身就说明了它主要在服务谁。

钱是怎么变出来的

那 97.8% 的差价,来自五种手法。它们的共同点是:成本被转移给了别人。

免费额度滥用。 自动化批量注册账号领免费额度,再把流量代理回自己的终端用户。上游为获客支付的营销成本,变成了中转站的进货。

拒付攻击。 用完一个计费周期之后发起 chargeback 把钱要回来,或者干脆从一开始就用盗刷的卡。

预付卡。 用有额度上限的预付卡充值,跑满即弃。

开放推理(open inference)。 这一条最值得产品团队盯着看——**任何一个没有严格护栏的客服聊天机器人,都可能被拿来代理流量。**你以为你上线的是售前答疑,实际上你上线的是一个免费的、你自己付费的 LLM 端点。

钱包耗尽(denial of wallet)。 严格说不属于中转站手法,是一种正在冒头的新型滥用:攻击者发起海量并发请求,纯粹为了烧掉服务商的预算。前面四种至少还有牟利动机,这一种没有——它的目的就是让你破产。这意味着传统的「反欺诈按收益建模」思路在这里失效,因为攻击者不追求收益。

谁在买,以及买家分三种

论坛里的讨论把买家动机说得很直白,主要是三类:便宜的 token、绕开地区限制、模型蒸馏。

前两类好理解。第三类是这条产业链真正的利润中心。帖子里的原话(翻译):

「用 Claude/CodeX 模型蒸馏训练国产模型。有专门做蒸馏的中间商,能提供相关证据,但我不能点名具体的国内公司。反正编程能力强的公司都在蒸馏 Claude,这是一条数十亿人民币规模的产业链,很多大玩家一天能赚几十万。」

「不只是真的——业内很多做蒸馏的已经赚到几百万了。」

以及一条关于规模的:「第一天上线就跑了 20TB。」

把这些串起来,那个 97.8% 的折扣就解释得通了:廉价 token 不是这门生意的产品,是它的获客渠道。真正的产品是流经这个网关的内容——你的 prompt、你的代码上下文、你的多轮推理轨迹。这些东西对下游做蒸馏的买家来说是高质量训练语料,而且是带标注的(因为上游模型的回答就是标签)。

所以那句老话在这里字面成立:**当你没有为产品付费时,你就是产品。**只不过在这里,你其实付了费——只是付得太少了,少到不足以覆盖成本,那么差额必然从别的地方补。

最容易被忽略的一条:应用层也是库存

如果这篇文章你只记一件事,我希望是这件。

研究里有一段容易被读过去:号池的库存并不只有 lab 的 API key。除了 OpenAI、Anthropic、Google 的直接凭证之外,还有大量从应用层收割来的账号——论坛里相当一部分活动围绕着对 Kiro、antigravity 这类消费级产品的「逆向」接入,这些不是实验室 API,是别人做的应用。

对号池来说,一个 token 来自实验室还是来自某个建在实验室之上的 App,没有任何区别。任何转售或暴露模型能力的东西,都是目标。

这句话的推论很硬:

只要你的产品把模型能力暴露给了用户,你就已经是一个 token 供应商——不管你愿不愿意。

你的免费试用额度是库存。你的客服机器人是库存。你那个忘了加速率限制的 /api/chat 是库存。你为了转化率而设计的「无需注册即可试用」是库存质量最好的那种。

大多数团队在做 AI 产品的成本模型时,算的是「预期用户数 × 人均调用量」。这个模型里没有一项叫「被当成中转站上游的那部分」。而按照上面的结构,你的产品越好用、护栏越松、注册越容易,你在号池里的库存等级就越高。

一个细节:抽奖里的公平性剧场

研究里有个细节我觉得是整篇最耐人寻味的。

一家中转站比价网站——它对外的定位是「中转站真伪核验 + 比价工具」——每天抽奖送出 50 个价值 100 美元的 API key。每日签到赚积分,20 积分一张票,每轮最多买三张。某一轮有 1150 张票在争这 50 个 key。

关键在于抽奖机制:这个抽奖是可验证公平的(provably fair)。随机种子取最新的比特币区块哈希,用 Partial Fisher-Yates 洗牌选出中奖者,全部参与名单在开奖前公示快照——这是正规加密货币赌博网站用来自证没有作弊的那套密码学方案。

请体会一下这里的荒诞:一个分发来路不明凭证的市场,为了让参与者相信抽奖没有内定,引入了区块链级别的可验证公平。

但这个荒诞恰恰是最有信息量的信号。**密码学信任是拿来填补制度信任的空缺的。**这个市场里所有人都知道对手方随时可能跑路、掺假、卖假货,所以它必须从外部导入一套不依赖信任的机制。会走到这一步,说明市场内部的欺诈问题已经严重到需要工程手段来解决——连骗子都在被骗。

顺带说一下我的实测:那个 V2EX 原帖至今可正常访问(返回 200);比价站返回 301 跳转;而那个抽奖页对我的请求返回 403——它对访问来源做了拦截。一个公开做流量生意的站点会拦截什么样的访问,答案不难猜。

那么,你该做什么

分两种身份说,因为大多数开发者两种身份都占。

如果你是买方

**别买。**这不是道德劝告,是风险计算——你实际承担的成本远超那 97% 的折扣:

  1. 模型偷换。 你按 Opus 付费,返回的可能是个便宜得多的模型。你的评测基线从此建立在流沙上,而且你不会知道。
  2. 数据去向不可解释。 你的 prompt 和代码上下文流经了一个你不知道是谁的网关,并且大概率被留存转售。任何一次合规审计里,这一条都无法回答。
  3. 可用性是假的。 池子里的账号被批量风控是常态,故障转移只能掩盖一部分。你的生产服务的 SLA 实际取决于一群盗刷账号的存活曲线。
  4. 连坐风险。 上游供应商在追查滥用时,识别的是流量特征。

便宜确实有正规解法:OpenRouter 这类聚合网关(一个 key 打通几百个模型,加很薄的一层加价)、AWS Bedrock / Azure Foundry 这类带合规认证和统一账单的云转售,以及最朴素的——换模型档位。DeepSeek 这类的输出价格本来就在每百万 token 几毛钱的量级,和头部闭源模型差着两个数量级。用不着为了省钱去灰色地带,降一档模型的省钱幅度,通常比中转站的折扣更实在,而且没有尾部风险

(顺带回应一个常见误解:如果你的目标只是省钱,先算每任务成本而不是每 token 单价。这一点我在上一篇关于 Kimi K3 的分析里展开过——单价打五折但 token 用量翻倍,等于没省。)

如果你在做 AI 产品

你是这条链的上游库存,防御要按「一定会被打」来设计。按滥用的行进顺序:

1. 抬高开户成本。 让批量注册变难,限制新账号能花掉多少。检测浏览器自动化信号——所有客户端检测都能被绕过,但每一层摩擦都在抬高攻击者的单位成本,而这个市场对成本极其敏感(毕竟它的整个商业模式就是成本套利)。

2. 盯住钱。 预付卡、虚拟卡、账单信息不一致、小额试卡扣款,这几个信号的准确率很高。

3. 盯住行为。 找真实用户不会产生的模式:注册到首个 token 的时间间隔、选择的模型、prompt 与你产品的相关度、账号年龄、IP 属性(代理 / VPN / 国别)。「prompt 与产品无关」这一条尤其有效——一个来蹭你算力的请求,内容和你的业务场景通常毫无关系。

4. 把账号聚类。 找 IP 女巫和共享设备指纹,把表面上独立的账号收敛回同一个运营者。

5. 给 AI 支出上监控和告警。 这是失效保护,不是优化项。denial of wallet 攻击可以在几小时内烧掉一个季度的预算,你需要的是能在几分钟内发现并关闭的能力。

6. 假设一定有漏网的,限制它能造成的损失。 按账号强制支出上限、支出锁、并发上限;为每个在途请求预留预算,否则并发调用可以轻松冲破你的限额;新账号从低额度起步,靠账龄和验证过的卡逐步提额;会话中途风险上升时插入验证码或二次身份验证。

7. 抓到了要静默降速,不要给干净的报错。 一个明确的错误信息等于告诉攻击者该修哪个特征——他们改完就回来了。

一句话判断

Anthropic 在 2025 年 9 月收紧了访问规则,2026 年 4 月对部分用户要求照片身份验证,7 月 8 日的新政策进一步引入政府证件和生物识别。很多开发者抱怨这些摩擦。

**这些摩擦不是产品经理想加的,是被这条产业链逼出来的。**正规开发者付出的注册成本,是这个灰产的外部性——账单最终由所有人分摊。

而研究者的判断我认同:随着实验室层面的 KYC 收紧,滥用不会消失,只会迁移。迁到哪去?迁到防御最薄弱、也最没意识到自己是目标的那一层——应用层,也就是你我在做的东西。

所以这篇文章真正的结论不是「别买便宜 token」,而是:

在 AI 产品的成本模型里,「被滥用的那部分」是一个必须显式列出的成本项,不是一个意外。

现在去看一眼你的 /api/chat 有没有速率限制吧。


本文一手材料来自 Matt Lenhard(Vectoral)2026 年 6 月 28 日发表的威胁研究《An Inside Look at the Relay Market Powering Token Resellers and Fraud》,其原始信源为 V2EX 讨论帖 t/1196011(2026 年 3 月 5 日至 6 月 23 日)。价格换算出自该帖 #50 楼的推算。GitHub 项目数据、以及相关站点的可访问性,为作者于 2026 年 7 月 26 日实测。本文为分析性报道,不提供任何中转站的访问方式,也不建议读者使用此类服务。