
随着大模型与Agent走向规模化落地,AI基础设施的重心渐渐转移。
过去几年里,业界的目光几乎全放在了算力上,可当算力集群的规模从千卡走向万卡乃至十万卡,一个个隐藏的瓶颈开始浮现。
在训练场景中,大模型参数从千亿级迈向十万亿级,通信时延、网络拥塞等问题,严重拖累有效算力利用率;在推理场景中,上下文序列扩展至百万级,KV Cache规模快速增长,内存和存储的带宽、容量与命中率,直接影响推理吞吐量和首Token延迟。
行业需要的不只是更强的CPU、GPU/NPU,网络、存储、DPU等计算模组需要同步升级。怎么满足不同场景下的性能需求,同时适配客户既有的技术路线,成了必须回答的新问题。
华为计算模组给出的答案是——提供高可靠的硬件产品与全链路技术支持,和伙伴、开发者一起共筑产业生态。
一方面以开放兼容激活生态活力,华为计算模组全面支持ARM/x86架构,兼容openEuler、Ubuntu等主流操作系统,不断打通技术适配边界,推动生态共建共荣。
另一方面,我们坚持自主创新,网卡、SSD、DPU、RAID卡等产品的多项关键性能指标业界领先,形成了完整的存储与网络模组产品矩阵,覆盖通算、智算全场景。
特别是在华为全联接大会2026上重磅发布的AI网卡和KVU,分别瞄准了网络通信与KV Cache瓶颈。
以网强算:为计算集群修一条“高速公路”
在不少人的认知里,网络被视为计算集群的配套,只要带宽数字匹配即可。时间来到2026年,传统逻辑被彻底颠覆。
当前沿大模型的参数量攀升至10万亿量级,训练序列迈入百万级,节点与节点之间需要频繁同步海量梯度与中间参数。相关研究表明,在大规模分布式训练中,网络通信耗时占比已经达到30-50%。
同时Agent、长文本、多模态的普及,让网络流量结构发生了质变:推理任务重的集合通信占比高达30%以上。由于长尾效应,哪怕是网络通信的微小抖动,用户感知到的都可能是“严重卡顿”。

面对日益凸显的网络通信瓶颈,作为国内首发的800G AI网卡,SP560系列在上万个计算节点间,修了一条承载数据流动的“高速公路”,用硬核技术正面解答了行业最关心的三道必答题。
第一道题:带宽够不够大?
目前业界公认的算连比维持在2到2.5之间,网卡带宽需求已经提升到800Gbps,预计2028年将摸高到1.6Tbps。
面向超节点Scale-out设计的SP560系列,支持10万级的RoCE的大规模组网,创新采用灵衢与PCIe双总线架构,总线带宽最大可达1.6Tbps,可帮助客户把网络性能彻底释放出来。
第二道题:协议够不够灵活?
AI网络有着鲜明的负载特征,即大量短流与少量长流交织并存,可能出现严重的链路阻塞,整网利用率不足40%。
为了满足头部客户自定义协议的需求,基于可编程NP架构的SP560系列网卡,支持客户针对业务自适应扩展RDMA协议、TCP协议与各类高阶拥塞控制算法,通过网卡硬件端直接实现多路径分发、乱序重排与选择性重传,可将整个集群的网络链路利用率拉升至85%以上。
第三道题:通信够不够高效?
在传统服务器架构中,网卡和算力的数据传送主要依赖CPU下发控制指令,造成了大量总线带宽损耗与交互延迟。
SP560系列网卡进行了两个方向的优化:
一个是GPU/NPU直驱与通信任务编排卸载,打通算力卡直接控制与管理网卡的通路,跳过CPU的二次中转,同时支持以集合通信组的粒度直接解析通信矩阵并下发报文,大幅的降低通信任务调度开销。
另一个是数控分离架构,将控制面流量与数据面流量隔离,控制面流量上送CPU处理,海量的数据面业务流量则通过灵衢高速总线直通GPU/NPU显存,进而实现数据免CPU拷贝,降低NPU的通信时延。
如果把算力比作计算集群的“心脏”,网络就是“大动脉”。算力决定上限,网络决定边界。只有把每一张卡真正“串”起来,AI集群才能从“堆起来”变成“跑起来”,才能支撑起更多、更大、更聪明的智算集群。
以存代算:给“爆仓”的KV Cache找一个新家
解决了“卡间运力”,为大模型训练和推理扫清了网络障碍。想要进一步提升算力利用率,必须打破“存储墙”和“内存墙”。
大模型的推理过程是自回归的,每生成一个新的Token,都要把历史KV Cache从显存里搬来搬去。在百万Token上下文场景下,KV Cache的显存开销常常占到整体的90%以上。
倘若把KV Cache全放在显存里,硬件采购成本与能耗增长,将让商业化落地化为泡影;倘若把KV Cache下沉到常规的SSD里,面对大批量并发读取时极易出现队列拥塞,导致推理首Token延迟飙升。
计算瓶颈的切换,标志着存储角色的重构:过去只是“数据仓库”,负责存放训练数据、模型权重;现在开始直接参与推理过程,通过KV Cache分层、缓存和复用,帮助释放宝贵的计算资源。

针对传统存储介质无法兼顾容量、时延与带宽的症结,华为计算模组推出了专为大模型推理设计的产品——KVU(KV Cache Unit)。
有别于被动存储的硬盘属性,KVU在模组内部深度集成了计算核心,实现了本地数据预处理能力;依托灵衢互联,KVU单卡最高支持64TB的海量存储空间、单卡顺序读带宽达到了40GB/s、顺序写带宽达到20GB/s、随机读IOPS超过500万。
基于KVU的出色性能,华为计算模组围绕“想做百万Token长上下文,却卡在显存不足、成本过高、命中率低、延迟不稳”的落地痛点,打造了兼顾性能与成本的四级KV Cache存储体系。
L1层(HBM):具备TB/s级超高带宽,用于常驻和处理当前正在参与计算的最活跃、最高频的热KV数据;
L2层(DDR内存池):具备纳秒级低时延,承接中小规模并发下的过渡态热KV数据,作为HBM与下层介质之间的弹性缓冲层;
L2.5层(KVU计算模组):作为连接显存与传统闪存之间的核心锚点,以超高带宽、微秒级读写时延,高效承接大容量次热与温态KV Cache。
L3层(通用大容量本地SSD):负责规模化长期留存低频访问的冷态KV数据与历史状态日志。
相关测试结果显示:依靠KVU模组自带的算力,大量前缀查找、缓存校验与格式转化操作,直接在模组内部并行完成。在实际大模型推理业务中,通过Prefix KV-Cache分级缓存管理机制,NPU利用率提升了30%,首token时延降低了50%。
截止到目前,KVU方案已经在多家长文本Agent、多模态推理、企业级智算中心项目测试验证,大幅降低了显存占用,真正实现了“不堆天价HBM,也能落地超高规格长上下文AI业务”。
写在最后
进入Agentic AI时代,一场深层次的变革正在上演。
大模型的参数规模越来越大、Agent任务链越来越长,AI基础设施需要进一步向纵深推进,既要解决核心算力“有没有”的问题,也要回答关键模组“强不强”的问题。
单点堆算力的时代已成过去,技术创新与生态开放才是智算时代的胜负手。以自主创新打破行业瓶颈、以开放兼容使能产业伙伴、以多元产品满足差异化需求,既是华为计算模组交出的工程答卷,也是AI从参数竞赛走向规模化落地的必由之路。

评论交流