深度拆解昇腾950DT NPU微架构:为千卡超节点设计的大模型训练专用芯片
深度拆解昇腾950DT NPU微架构:为千卡超节点设计的大模型训练专用芯片深度拆解昇腾 950DT NPU 微架构:为千卡超节点设计的大模型训练专用芯片作者注:本文所有技术参数均来自 WAIC2026 华为昇腾技术分论坛公开披露信息,作者基于 20 年 ICT 软硬件架构经验做技术拆解,内容仅供学习研究参考。引言在 WAIC2026 上发布的昇腾 950 SuperPoD 超节点,核心是代号为 950DT 的新一代 NPU 芯片。和上一代昇腾 910B 面向通用 AI 计算场景的设计思路不同,950DT 从立项之初就瞄准千卡级超节点的大模型训练场景,不再单纯追求单卡理论算力的堆砌,而是从计算核心、存储层次、片间互联、硬件加速、软件协同全栈做全局优化,解决传统分布式集群 “通信墙”“内存墙” 的核心痛点。对于开发者而言,理解 950DT 的微架构设计,不仅能更好地做算子优化和性能调优,也能看到国产 NPU 从 “单卡性能跟随” 到 “系统级架构创新” 的思路转变。本文将从计算核心、存储子系统、互联架构、专用加速模块、软件协同几个维度,对 950DT 做全面的技术拆解。一、达芬奇架构 3.0:重构大模型训练的计算核心950DT 采用升级后的达芬奇 3.0 架构,针对大模型训练的计算特征做了针对性的计算单元重构,而不是在原有架构上做简单的工艺升级和频率提升。1.1混合精度张量核心升级大模型训练已经全面进入 FP8/FP4 混合精度时代,950DT 在每个 AI Core 中集成了专用的 FP8/FP4 张量计算单元,支持 E4M3/E5M2 两种 FP8 格式和多种 FP4 编码格式,单芯片 FP8 理论算力达到 1PFLOPS,FP4 理论算力达到 2PFLOPS,相比上一代 910B 提升了 2.5 倍。和其他 NPU 不同的是,950DT 的张量