算力战争2.0:从堆GPU到按Token计费,三条路线正在赛跑

AI算力芯片架构示意图,三颗芯片通过光纤互联

云天励飞在WAIC 2026上发了一张芯片路线图,上面没有标TFLOPS。

这张图把AI推理拆成了三道工序:Prefill(预填充)、Decode Attention(解码注意力)、Decode FFN(解码前馈网络),每道工序用不同的芯片去跑。董事长陈宁在台上说了一句话,台下安静了几秒——”规模化之后,算力的价值指标不是TFLOPS,而是系统稳定产出多少Token、每Token多少钱。”

这句话正在改变整个算力产业的竞争逻辑。

🆚 旧逻辑 vs 新逻辑

维度 旧逻辑(2023-2025) 新逻辑(2026-)
核心指标 单卡TFLOPS 每Token成本
竞争焦点 谁的芯片算力峰值高 谁的系统产出Token多且便宜
架构思路 一颗芯片通吃所有 按推理流水线做工序级切分
互联方式 单机Scale-up 千卡光互联Scale-out
成本衡量 买卡花了多少钱 跑完一百万Token花了多少钱

转变的根本原因:大模型从训练阶段进入推理阶段。

训练的时候,你买几千张卡,跑几个月,出一个大模型。算力消耗是可预测的一次性投入。但推理不是——用户每问一次问题,都要消耗算力。中国AI大模型日均Token调用量已突破140万亿,较2024年初增长超千倍。

140万亿。每天。

这个数字还在涨。当算力消耗从”训练一次”变成”每天烧”,单卡峰值就不再是重点了——系统吞吐和单位成本才是。

🔧 三条技术路线正在赛跑

目前国内算力突围有三条主要路线,各有优劣:

路线一:异构三芯(云天励飞DeepVerse)

把推理流水线拆成三段,每段一颗专用芯片。DeepVerse100P管Prefill,100D管Decode Attention并支持1024卡光互联,100L用3D Memory架构啃Decode FFN。

好处是每个环节效率最优,坏处是三颗芯片的协同调度复杂度极高。这路线还在验证阶段,但思路够大胆。

路线二:RISC-V融合CPU(蓝芯LX500)

48核异构、75 TOPS INT8,统一内存管理消除CPU和加速卡之间的数据搬运。联想问天WR5219 G5服务器已搭载量产下线,实测同等功耗推理+30%、同等吞吐采购成本-20%。

这条路的意义不在单颗芯片参数,在于RISC-V从嵌入式走向了服务器机房。如果RISC-V能在数据中心站稳脚跟,ARM和x86的格局会被重新定义。

路线三:国产GPU旗舰对标(天数智芯天垓300)

基于SIMT架构,对标Hopper架构主流方案。Agent场景首字延迟降约20%,Decode通信延迟降13%,Cosmos3世界模型推理效能超Hopper 10%。

这是正面硬刚的路线——用国产GPU直接对标英伟达Hopper。参数不输,但生态差距还在。CUDA的护城河不是一两年能填平的。

💰 价格战的底层是算力战

为什么大模型API价格能跌到白菜价?不是模型公司在做慈善,是算力成本在下降。

DeepSeek V4首次采用峰谷计费:Pro版每百万输出Token低谷约0.87美元、高峰约1.74美元。Kimi K3的API定价约为Claude Fable 5的三分之一。

这些数字的底层支撑是什么?

  • 昇腾950超节点支持1024卡高速互联,让万卡集群”像一台计算机一样协同工作”
  • DeepSeek V4-Pro的价格会随超节点量产进一步下调
  • 蓝芯LX500让同等吞吐的采购成本下降20%
  • 天数智芯天垓300在推理效能上超越Hopper 10%

每一个百分点效率提升,传导到终端就是API价格再降一档。大模型价格战的本质,是算力效率战。

🏠 另一个赛场:桌面AI超算

7月24日,技嘉桌面AI超算竞赛在北京开赛。11支队伍在48小时内基于AI TOP ATOM平台做本地AI开发。

这件事看起来是个小比赛,但背后的趋势值得注意:AI算力正在从云端向桌面端下沉。

本地大模型部署、私有化知识库、模型微调——这些需求催生了一个新市场:桌面级AI超算。数据不出域,是很多企业的硬需求。当桌面设备的算力足够跑量化版万亿参数模型,云计算的垄断地位会被动摇。

当然,桌面AI超算目前还远不能替代云端集群。但它代表了一个方向:算力去中心化。

🌐 大模型厂集体”去英伟达化”

不只中国在找替代方案。

Anthropic已启动自研AI芯片早期规划,与三星谈SF2 2nm代工。Google有TPU,Amazon有Trainium,OpenAI六月刚跟Broadcom端出Jalapeño芯片。

大模型公司集体造芯片,原因只有一个:英伟达太贵了。

当你的模型每天被调用140万亿次,每一分算力成本差异都会被放大成天文数字。与其把钱交给黄仁勋,不如自己造芯片——哪怕良率低、周期长,长期看也比被卡脖子强。

Anthropic选三星而非台积电,核心考量是台积电2nm产能被锁到2028年后,三星Taylor厂2027-2028的窗口更匹配。这个选择本身就说明:芯片产能已经成了战略资源,排队都要抢。

⚡ 还有一个变量

以上所有分析都建立在一个前提上:推理算力需求会持续增长。

如果这个前提变了呢?

比如——模型架构发生根本性突破,万亿参数模型可以被压缩到百亿参数同等效果。或者——端侧芯片性能飞跃,大部分推理在手机上完成,云端算力需求增速放缓。

这些不是空想。Kimi K3已经证明了开源模型追平闭源的可能性。如果模型效率持续提升,算力需求曲线可能不会像现在预测的那样指数增长。

但至少在2026年,这个转折点还没到来。算力战争,才刚刚从”堆GPU”阶段进入”系统效率”阶段。

下一站是哪里,所有人都在找。

© 版权声明
THE END
喜欢就支持一下吧
点赞15 分享