AI推理服务器崛起:推理算力需求超训练4-5倍,国产芯片迎来黄金机遇
💡三组关键数据揭示趋势:
① 曦望董事长徐冰预测:2026年AI推理算力需求将达到训练需求的4-5倍,推理算力租赁价格半年内上涨近40%
② IDC预计:到2028年,推理工作负载占比将攀升至73%
③ 美银预计:2026年训练服务器与推理服务器营收将平分秋色,2030年推理占比将达75%
英伟达CEO黄仁勋观点更为激进:AI推理的规模将迅速达到训练负载的十亿倍。
成本构成
训练服务器
推理服务器
区别
计算单元(GPU/ASIC)
38%
25-30%
推理对单卡算力需求相对较低
存储组件(内存+SSD)
29%
35-40%
推理对内存容量和带宽需求更高
网络互联
18%
15%
推理集群互联需求略低
电源与散热
15%
15%
功耗低于训练服务器
维度
国际先进
国内先进
代差
推理GPU/ASIC性能
英伟达B200、Google TPU v8
昇腾950、曦望S3
12-18个月
P/D分离架构商用
2025(谷歌/英伟达)
2026(华为/联想)
6-12个月
超节点推理集群
2025(英伟达NVL72)
2026(华为Atlas950等)
6-12个月
推理成本(每Token)
国际领先水平
曦望目标"百万Token一分钱"
差距在缩小
⚠️该赛道最大的潜在风险是:推理需求的爆发速度远超芯片产能的释放速度。
环节
利润占比
说明
推理芯片(英伟达/AMD/国产)
40%-50%
芯片是推理的核心成本项
推理服务器整机(中国厂商)
10%-15%
依靠规模和效率获取利润
推理云服务/MaaS平台
25%-35%
附加值最高
其他(网络/数据中心)
10%-15%
基础设施成本
💡 与DSP芯片(倒挂率1.5)、硅光模块(倒挂率2.7)、AI训练服务器创业公司(倒挂率5.0)相比,推理赛道的估值倒挂相对温和——因为二级市场已有英伟达作为估值锚点,倒挂空间被压缩。但推理赛道的一级估值(20-40倍PS)已接近甚至超过英伟达,市场对"推理爆发"的逻辑给予了极高溢价。
📌本文核心要点回顾:
① 2026年AI推理算力需求达训练4-5倍,IDC预测2028年推理工作负载占比73%
② 曦望完成超10亿元融资、七轮累计40亿、估值超百亿,S3目标"百万Token一分钱"
③ Baseten完成15亿美元融资、估值130亿美元,推理云服务是比硬件更丰厚的利润池
④ 华为昇腾950PR/950DT以P/D分离架构率先布局,Atlas 950超节点计划2026 Q4发布
⑤ 最大潜在风险:推理需求爆发速度远超芯片产能,算力租赁价格半年涨40%
⑥ 集邦咨询:2026年ASIC AI服务器出货占比将提升至27.8%,为2023年以来最高