BndEcEnd_昭逢幸运潮生
26-09-17 17:34 微博认证:情感博主 超话创作官(王俊凯超话) 微博原创视频博主

#华为昇腾960#

一、事件经过

登上热搜,2026华为全联接大会上,华为正式公布新一代AI芯片昇腾960系列,研发进度超出预期,相比原定路线大幅提前,同步发布搭载NPO近封装光学技术的昇腾960超节点,引发科技圈广泛热议 。

昇腾960分为两个版本:昇腾960DT(训练版)2027年Q1就绪,较原计划提前三个季度;昇腾960PR(推理版)2027年Q3就绪,提前一个季度。
单卡算力实现翻倍,FP8算力2PFLOPS、FP4算力4PFLOPS,最大支持288GB HBM高带宽内存,访存带宽达到9.6TB/s。
配套的昇腾960超节点,搭载自研Hi‑ONE NPO光引擎,单超节点最大4096卡规模,FP8算力可达8EFLOPS,HBM总容量1PB,系统可用度99.8%,支持扩展到数十万卡的超大集群,面向十万亿参数大模型训练推理场景。
华为同时公布后续路线:昇腾970(2028)、昇腾980(2029),保持一年一代、算力持续翻倍的演进节奏。

二、核心背景

1. 硬件核心升级:算力+内存+互联全面跃升
昇腾960对比上代产品,算力、内存容量、访存带宽全部实现翻倍,支持多种高精度与低精度数据格式,适配大模型训练、多模态推理各类AI场景。
本次最大亮点不只是芯片本身,而是NPO近封装光学Hi‑ONE光引擎,用光互联替代传统大量光模块,大幅降低功耗、提升集群互联带宽,解决超大AI集群的互联瓶颈,是国内首个量产落地的NPO方案 。
2. 超节点架构,面向超大模型时代
随着大模型参数走向十万亿级别,单机卡已经无法满足训练需求。昇腾960超节点通过灵衢全光组网,实现多卡统一内存编址,单节点4096卡,多节点组网最高可扩展至51.2万卡集群,满足国内智算中心、大模型厂商建设大规模算力底座的需求。
风冷版本2027年Q2上市,液冷版本2027年Q3上市,兼顾能耗与可靠性。
3. 国产算力的现实挑战
硬件纸面规格亮眼,但行业也客观看到现存短板:
一方面CANN软件生态仍在持续完善,部分开源模型迁移、算子适配还需要一定开发成本;另一方面,芯片要等到2027年才会正式就绪,距离大规模商用还有时间周期,需要等待落地实测验证真实性能表现。
4. 产业战略意义
昇腾960+NPO超节点,是国产AI算力从单卡性能走向集群系统能力的重要一步。面向国内大模型发展、智算中心建设,提供一套完整自主可控的算力底座方案,减少对外依赖,推动国内AI产业自主迭代 。

三、网友观点

- 研发进度提前,算力直接翻倍,国产AI芯片迭代速度肉眼可见。
- 最大突破是NPO光互联,解决大集群互联痛点,不再只堆单卡算力。
- 期待2027年落地后的实测表现,纸面参数好看,实际训练效率才是关键。
- 硬件上来了,软件生态、算子适配还要继续补齐,生态建设任重道远。
- 一年一代路线规划清晰,为国内大模型发展提供算力底座支撑。
- 超大集群能力,对国内智算中心、科研机构是重大利好。

四、深度反思

热搜背后,折射出国产AI算力行业的发展现状。

过去大家更多关注单卡算力参数,而昇腾960把重点放在芯片+光互联+超节点集群整套系统能力。大模型时代,单纯单卡性能已经不够,大规模集群的互联、功耗、稳定性,才是决定算力能不能真正用起来的关键,NPO光引擎就是针对这个痛点的系统级创新 。

硬件规格的提升值得肯定,但算力的价值最终要落到软件生态与实际落地。CANN生态持续开源完善,模型迁移成本、算子适配效率,依然是国产算力需要持续攻克的课题。

昇腾960代表国产算力的技术方向,2027年正式交付之后,还需要经过真实大模型训练、推理场景的检验。硬件突破是起点,完整的软硬件协同生态,才是国产算力真正站稳脚跟的核心。

http://t.cn/AXOapmMw

发布于 重庆