有一个转折点很多人还没意识到:推理消耗超过训练消耗的那一刻,算力就从「项目制支出」变成了「水电费式支出」。按公开的行业增速推算,这个转折已经发生了。
AI浪潮持续推进,全社会算力需求迎来暴涨。但「暴涨」这个词太笼统——暴涨的到底是训练需求还是推理需求,决定了底座该往哪个方向建。
算一算推理什么时候反超训练
```python
训练 vs 推理 算力消耗占比推演(示意)
train, infer = 100.0, 40.0 # 起始消耗量(相对值)
year = 0
图5|图片来源:Flickr 公共图库(CC BY 2.0),摄影师署名见图片左下角水印
while infer <= train:
year += 1
train *= 1.25 # 训练年增 25%
infer *= 1.80 # 推理年增 80%(应用铺开更快)
print(f"第 {year} 年推理反超训练") # 第 3 年
print(f"此时占比:训练 {train/(train+infer):.0%},推理 {infer/(train+infer):.0%}")
训练 40%,推理 60%
`图4|图片来源:Flickr 公共图库(CC BY 2.0),摄影师署名见图片左下角水印
三年之内格局倒转。训练是脉冲式的——一个模型练完就停;推理是常态化的——只要有人用,它就一直在跑。这个结构性变化直接改变了底座的建设标准。
底座提速,提的是哪三个速度
需求侧变化 | 底座必须跟上的能力 | 不跟上的后果 |
推理常态化 | 弹性伸缩、按需起停 | 高峰卡不够,低谷白付钱 |
时延敏感化 | 就近部署、边缘算力 | 响应慢,体验直接崩 |
调用碎片化 | 细粒度计费、秒级调度 | 计费口径粗,用户不敢用 |
看第二行——时延敏感是推理时代的新约束。训练任务放在西部电便宜的地方完全没问题,但推理要贴近用户。所以底座不会是「一个超大集群」,而是「大集群 + 区域节点 + 边缘」的分层结构。
训练比的是谁能建得大,推理比的是谁能铺得近。这是两种完全不同的基建逻辑。
需求侧的三个确定性
- 确定性一:渗透率还很低。大部分传统行业的 AI 使用仍停留在试点阶段,一旦进入常态化流程,消耗量是数量级的跳变。
- 确定性二:多模态是耗电大户。文字转图像、视频理解、语音实时交互,单次调用的算力消耗远高于纯文本。
- 确定性三:单价下降会放大总量。单位成本降低会催生大量原本不划算的应用场景,需求曲线往右移。
别只盯着训练那点热闹
行业讨论总被最新模型的训练规模吸引,但真正决定算力生意能不能赚钱的是推理侧的日常流水。训练是一次性大单,推理是每天都来的小额多笔。做生意的人都懂:稳定的小额多笔比偶发的大单更值钱。
这也解释了为什么越来越多的资源被投向推理优化——量化、蒸馏、KV 缓存复用、批处理调度。这些技术直接降低每次调用的成本,而每次调用的成本乘以调用量,就是全部账单。
推理优化的杠杆有多大
推理是每天都发生的支出,所以这里的优化收益是复利式的:
```python
推理侧工程优化的成本杠杆(示意,相对值)
cost, calls_per_day = 1.0, 5e8
for step, factor in [("动态批处理", 0.45), ("KV 缓存复用", 0.70), ("请求合并", 0.85)]:
cost *= factor
print(f"叠加 {step}:单次成本降至 {cost:.3f}")
print(f"按每天 5 亿次调用,单次省 {1-cost:.3f} 相当于每天省下 {(1-cost)*calls_per_day/1e8:.2f} 亿次等效算力")
批处理 → 0.450|缓存 → 0.315|合并 → 0.268;每天省约 3.66 亿次等效
`
三项工程优化叠加,单次推理成本降到原来的 26.8%。** 在每天几亿次调用的量级上,这不是省了一点电费,而是等于凭空多出三倍多的服务能力。**推理时代,工程优化就是产能。
一个容易被忽略的短板
底座里最容易被忽略的一环不是算力,是数据的流动能力。算力再多,数据出不来、跨不了域、对不上格式,模型就是空转。很多所谓「算力不够」的场景,实际卡在数据治理上——这部分投入不性感,但它决定了算力能不能真正变成产出。
边缘算力的空间在哪
推理贴近用户,就给边缘留出了位置。但边缘不是万能的,它有清晰的适用边界:
时延要求 | 适合部署位置 | 典型场景 |
10 毫秒以内 | 本地设备 / 现场边缘 | 工业质检、实时控制 |
10-50 毫秒 | 城市级区域节点 | 语音交互、实时翻译 |
50-200 毫秒 | 区域中心 | 常规问答、文档处理 |
不敏感 | 远端大集群 | 训练、批量分析 |
看第一行——10 毫秒以内的场景,网络物理距离就决定了必须放在现场,跟算力便宜不便宜没有关系。这类需求撑起了边缘算力的刚性市场。
而中间两档是竞争最激烈的地带:既要够近,又要够便宜。分层部署能力,会成为底座建设的核心竞争力之一。
回到你的日常:你最先感受到算力变化的场景是哪一个——是某个工具突然变快了,还是某项原本收费的功能突然免费了?这类具体的体感变化,往往比行业数据更早说明趋势。
参考资料 · 公开来源
- 工业和信息化部《算力基础设施高质量发展行动计划》
- Stanford HAI, AI Index Report(公开年度报告)
- 国家发展改革委等部门「东数西算」工程公开政策文件
- 中国信息通信研究院关于算力网络与边缘计算的公开研究报告