在华为今年全联接大会上,昇腾芯片的时间表成为最受关注的内容。华为轮值董事长汪涛披露,昇腾960DT研发进度比原计划提前三个季度,单芯片算力实现倍增,支持2 PFLOPS FP8、4 PFLOPS FP4,HBM容量最高288GB、带宽9.6TB/s。对应的昇腾960超节点做到4096张NPU卡,最高8 EFLOPS FP8算力、超过1PB HBM容量。汪涛同时公布后续路线:2028年昇腾970、2029年昇腾980,未来几年保持“一年一代”的演进节奏。
汪涛在接受采访时表示,从今年开始,950、960、970、980连续几代将坚持一年一代,走入快速演进节奏,这是国内半导体制造、封装的上下游配套全部打通之后才实现的。他透露,960芯片已在实验室测试数月,“芯片从立项到产品化往往要三年,我们任何一次发布,都是产品已经在实验室反复测试、有准确交付时间之后才做。”
华为此次想讲的不只是一颗更快的芯片。围绕960,华为把NPO光互联、超节点、CANN生态一并摆上台面。910C为384卡,950做到1024卡,960进一步扩到4096卡,并通过跨物理节点的统一内存编址,让多颗NPU互联更接近一台逻辑计算机。汪涛提到,从仿真训练看,在同样十万卡集群下,4096卡超节点组成的集群相对传统八卡服务器集群,MFU可提升2.75倍。
960超节点这一代最硬的新增技术是NPO(近封装光学)。华为用该架构做出的产品是Hi-ONE光引擎,单引擎集成36路200G,总传输容量7.2Tbps,并内置光源。汪涛将其领先性概括为“三个第一”:第一个规模商用、最大带宽、唯一内置光源。华为没有直接走向CPO,汪涛解释,CPO把光引擎和主芯片封在一起,光引擎坏了整个主芯片就报废,可用度差、故障成本高,目前尚不适合大规模商用。
汪涛反复强调,AI基础设施已进入系统工程阶段,只做好一颗芯片远远不够,只做一台服务器也不够,最后要交付一个高可用度的复杂系统才有价值。他认为,做好大规模超节点集群需要通信技术、IP、光模块、算力、系统等能力,华为干了30年,每个领域都有长期大规模研发投资,“把这些能力全部聚在一个团队里,似乎只有华为。”