对企业 AI Native 转型而言,“模型部署在哪里”不仅是一个技术架构问题,也是一道持续影响成本结构的经营题。
随着大模型在企业内部逐渐从试验走向规模化应用,一个问题迟早会摆在架构团队面前:
大模型究竟应该自建,还是直接调用外部厂商的 API?
自建意味着更强的数据控制力、服务自主性和模型可定制能力;调用外部 API 则可以减少基础设施投入,按实际用量付费,并享受厂商持续优化后的推理效率。
这些差异都很重要,但在讨论技术路线之前,我们首先需要回答一个朴素的问题:
在同样的业务调用量下,两种方案分别要花多少钱?
下面选取一组经过调整的典型单日业务样本,对这道题做一次完整测算。计算过程中最值得分享的,并不只是最终数字,而是一个很容易被忽略的变量——缓存命中率足以改变成本比较的结论。
打赏本文,自动回复会提供给下图这样的成本计算器下载链接。

下面的内容,本质上更好理解这个计算器怎么用。
一、先建立一个公平的比较口径
比较自建和外部 API,不能只把服务器成本与厂商单价并排放在一起。
服务器成本按“天”发生,API 则按输入 Token、输出 Token 和缓存 Token 分项计费,两者天然不是同一种计量单位。要让比较成立,必须先统一工作负载:
让自建集群和外部 API 完成同一天、同一批业务请求,再分别计算两种方案的成本。
这组单日业务样本如下:
当前采用集中式部署,因此本次先使用整体成本法,不对 Prefill 和 Decode 实例进行拆分。
二、自建成本:固定投入摊到实际 Token 上
自建方案的当日成本是 27,000 元。把它除以当天处理的总 Token,可以得到当前利用率下的综合单位成本:
自建综合成本= 27,000 ÷(4,650,000,000 ÷ 1,000,000)= 5.806 元/M Token
再按成功请求数计算,每次成功调用的平均成本为:
自建每次成功调用成本= 27,000 ÷ 100,000= 0.270 元/次
这里需要特别说明:5.806 元/M Token 是当前业务结构和集群利用率下的综合平均成本,不是输入 Token 或输出 Token 各自的独立单价。
在没有更细粒度 GPU 运行数据的情况下,不能仅凭 27,000 元总成本,客观拆出输入和输出各自消耗了多少钱。
三、如果忽略缓存,自建看起来更便宜
外部 API 的刊例价格如下:
如果暂时忽略缓存,把所有输入 Token 都按普通输入价格计算,那么官网费用为:
输入成本= 4,500 M × 8= 36,000 元输出成本= 150 M × 28= 4,200 元官网合计= 40,200 元/天
此时,自建每天只需要 27,000 元,比外部 API 少 13,200 元。单看这个结果,很容易得出“自建更划算”的判断。
但这个判断遗漏了外部 API 计费中最关键的变量之一:缓存命中。
四、80% 的缓存命中率,让结论发生反转
在真实的外部 API 调用中,大量重复的系统提示词、上下文模板和稳定前缀可以命中缓存。假设官网侧缓存命中率为 80%,输入 Token 就需要拆成两部分:
缓存命中 Token= 4,500,000,000 × 80%= 3,600,000,000未命中缓存 Token= 4,500,000,000 × 20%= 900,000,000
两类输入分别按缓存价格和普通输入价格计算,再加上输出费用:
未命中输入成本= 900 M × 8= 7,200 元缓存命中成本= 3,600 M × 2= 7,200 元输出成本= 150 M × 28= 4,200 元官网合计= 18,600 元/天
加入缓存后,外部 API 的日成本从 40,200 元下降到 18,600 元。
比较结果也随之反转:
在 80% 缓存命中率、尚未考虑商务折扣的情况下:
- 如果每天的业务量保持稳定,一年的成本差额约为 306.6 万元。
这正是本次测算最重要的发现:
比较自建和外部 API 时,如果没有把缓存计费纳入模型,很可能会得到方向相反的结论。
五、折扣也必须成为参数,而不是口头条件
企业采购外部模型服务时,实际执行价往往低于公开刊例价。因此,完整的成本模型还需要加入“官网折扣率”参数:
官网折后成本= 官网刊例成本 ×(1-官网折扣率)
当前测算默认折扣率为 0%,即完全按照刊例价比较。如果获得 20% 的商务折扣:
官网折后成本= 18,600 ×(1-20%)= 14,880 元/天
缓存优化与商务折扣的影响会叠加。缓存命中率越高、实际折扣越大,外部 API 的经济优势就越明显。
因此,折扣不能停留在“厂商应该会给优惠”的模糊表述上,而应该进入模型,成为一个可以随合同报价实时调整的参数。
六、不要只问谁更便宜,还要找到盈亏平衡点
静态比较只能回答“今天谁更便宜”,盈亏平衡分析才能回答“什么条件下结论会改变”。
1. 缓存命中率的盈亏平衡点
在官网折扣率为 0% 的情况下,按照当前输入输出结构计算,缓存命中率的盈亏平衡点约为 48.9%:
- 缓存命中率高于 48.9%:外部 API 成本更低;
- 当前假设为 80%:已经明显进入外部 API 更经济的区间。
这也意味着,评估外部 API 时,不能只向厂商询问输入和输出单价,还需要确认缓存机制、缓存命中口径,以及真实业务场景中能够达到的命中率。
2. 自建集群的业务量盈亏平衡点
自建集群的一个显著特点是固定成本较高,但边际成本可能较低。如果现有服务器还有剩余容量,随着业务量增加,单位 Token 分摊的成本会持续下降。
在 80% 缓存命中率、官网折扣率为 0%,并且输入输出结构不变的情况下,自建集群每天大约需要处理:
67.50 亿 Token/天
才能与外部 API 的成本基本持平。
当前处理量是 46.50 亿 Token/天,相当于还需要提升约 45.2%。
不过,这个推导有一个重要前提:新增业务量不能触发服务器扩容。 如果业务增长需要新增 GPU,固定成本就会形成新的台阶,不能继续按照现有 27,000 元简单线性外推。
七、真正影响架构选择的,是四组变量
从企业 AI Native 架构视角看,自建与外部 API 的成本差异主要由以下四组变量共同决定。
第一组:业务负载
输出 Token 的单价和推理开销通常更高。两家企业即使总 Token 相同,只要输入输出结构不同,最终成本也可能存在显著差异。
第二组:外部 API 的实际执行价
这里应该使用合同执行价和实际账单口径,而不是只引用官网刊例价格。
第三组:自建集群的真实成本与利用率
如果 27,000 元只包含服务器租赁,却没有包含电力、网络和运维,自建成本还会被低估;反过来,如果这笔成本包含了其他团队共享的基础设施,也需要合理分摊。
第四组:不能直接折算成 Token 的战略价值
自建方案即使账面成本更高,也可能创造额外的战略价值。真正的问题不是“自建一定要比 API 便宜”,而是:
自建带来的安全、可控和能力沉淀,是否值得为之支付额外成本?
在本次案例中,这个额外成本按照当前参数约为每年 306.6 万元。这就把一个抽象的架构争论,转化成了可以被管理和评估的经营问题。
八、结语:成本模型的价值,不是给出一个永久答案
在当前业务量、80% 缓存命中率和零折扣条件下,外部 API 的经济性明显优于自建部署。
但这不是一个永久不变的答案。
当业务量增加、自建集群利用率提升、官网价格变化、缓存策略调整或商务折扣落地时,结论都可能发生变化。成本测算真正有价值的地方,是把这些变量显性化,并让架构决策可以随着真实数据持续更新。
对于正在推进 AI Native 转型的企业,与其争论“自建好还是 API 好”,不如先建立一套透明、可复算、可做敏感性分析的成本模型,然后持续回答三个问题:
- 外部 API 的真实缓存命中率和最终执行折扣是多少?
- 数据安全、服务可控和能力沉淀等非价格价值,是否覆盖了自建的额外成本?
当这三个问题都有数据支撑时,自建还是外采,就不再是一场立场之争,而会成为一项可以被解释、被验证、也可以被动态调整的架构选择。
免责声明:
这个成本计算器,是基于我自身经验总结的,每家企业的计算方式可能不一样,仅做参考。