LatentMOE解析:将hiddensize降维投影到潜在空间
2026年1月英伟达提出了 LatentMoE 架构并在 Nemotron-3 模型中应用论文链接https://arxiv.org/pdf/2601.180897月月之暗面发布了2.8T参数的kimi k3同样使用了 LatentMOE 架构。简单来说LatentMOE 在传统的 MOE 架构的开始和末尾分别增加了对 hiddensize 维度的降维投影和还原降低计算和通信负载在基本相同的推理成本下可以计算更大的总专家数和激活专家数从而提高模型精度。在同样的精度要求下推理成本更低。架构原理h i d d e n s i z e hidden sizehiddensize隐藏层维度也常写作h i d d e n d i m e n s i o n hidden dimensionhiddendimension是 Transformer 大语言模型最核心的基础参数之一指每一个 token 在网络层间传递时的特征向量的长度可以直观理解为每个 token 用多长的向量来承载它的语义信息。如图所示在 LatentMoE 中每个 token 先通过可学习的下投影矩阵W ↓ W_{↓}W↓从模型隐藏维度空间R d R^{d}Rd投影到更低维度的隐空间R ℓ R^{ℓ}Rℓ中h i d d e n s i z e hidden sizehiddensize从d dd下降到ℓ再进行专家计算每个专家E i ( ⋅ ; ℓ ) E_i(⋅;ℓ)Ei(⋅;ℓ)完全在隐空间内运算其参数为权重W F C 1 ( i ) W_{FC1}^{(i)}WFC1(i)、W g a t e ( i ) ∈ R m × ℓ W_{gate}^{(i)}∈R^m×ℓWgate(i)∈Rm×ℓ与W F C 2 ( i ) ∈ R ℓ × m W_{FC2}^{(i)}∈R^ℓ×mWFC2(i)∈Rℓ×m。LatentMoE 的流程为先通过原始维度选出 top-k 专家 → 再对 token 做 down-proj 降维 → 再分发到隐空间的专家中计算。需要注意的是降维只作用于专家计算 all-to-all 通信环节不包含路由决策。共享专家全程工作在原始 d 维空间不经过隐空间投影。E i ( x ℓ ) W F C 2 ( i ) ⋅ ( σ ( W g a t e ( i ) ⋅ x ℓ ) ⏟ 门控掩码 ⊙ ( W F C 1 ( i ) ⋅ x ℓ ) ⏟ 特征内容 ) E_i(x_\ell) W_{FC2}^{(i)} \cdot \left( \underbrace{\sigma\left(W_{gate}^{(i)} \cdot x_\ell\right)}_{\text{门控掩码}} \odot \underbrace{\left(W_{FC1}^{(i)} \cdot x_\ell\right)}_{\text{特征内容}} \right)Ei(xℓ)WFC2(i)⋅门控掩码σ(Wgate(i)⋅xℓ)⊙特征内容(WFC1(i)⋅xℓ)专家计算完成后对输出结果聚合再通过可学习的上投影矩阵W ↑ ∈ R d × ℓ W_{↑} ∈R^{d}×ℓW↑∈Rd×ℓ映射回原始输入维度。经过下投影W ↓ W_{↓}W↓后token 的分发与聚合都在隐空间R ℓ R^{ℓ}Rℓ中进行这使得通信量相比标准 MoE 降低了α αα倍。同理由于专家权重位于隐空间维度为m × ℓ m×ℓm×ℓ与ℓ × m ℓ×mℓ×m权重加载的内存带宽成本也降低了α αα倍。通信、带宽与计算成本的降低为规模的扩展提供了基础。研究利用这部分效率增益将总专家数N NN与每个 token 激活的 top-k 专家数K KK同步扩大α d / ℓ αd/ℓαd/ℓ倍在整体推理成本基本不变的前提下提升模型精度可指数级提升专家多样性进而增强模型质量。由于K KK扩大了α d / ℓ αd/ℓαd/ℓ倍通信成本与内存带宽需求和标准 MoE 保持一致。但专家多样性的提升与每个 token 非线性单元预算的增加使其在同等推理成本下实现了更优的模型精度将模型的帕累托前沿推向新高度。实验评估为了方便对照研究设计了两种配置ℓ-MoE_eff只放大总专家数N不放大激活专家数K → 推理成本显著下降精度和基线持平对应 “用压缩换效率”ℓ-MoE_accN和K同步放大α倍 → 推理成本和基线完全持平精度显著提升对应 “成本不变结构改善精度”压缩比例对模型质量的影响研究假设存在内在有效特征秩r e f f r_{eff}reff当隐维度ℓ ≥ r e f f ℓ≥r_{eff}ℓ≥reff时压缩带来的信息损失可忽略图中结果表明在 ℓ-MoE_eff 配置下当压缩比例α ≤ 4 α≤4α≤4时模型质量得以保留。专家数量对模型质量的影响图中红色曲线为仅压缩4倍不扩大专家数量精度明显下降绿色曲线为压缩4倍并且专家数量扩大4倍不改变top-k激活专家数量也就是 ℓ-MoE_eff 配置验证损失与基线基本对齐压缩带来的精度损失被有效抵消。两种配置与基线对比上图对比了两种配置与基线的验证损失实验基于 160 亿总参、20 亿激活参模型隐维度 ℓ512α4。与预期一致ℓ-MoE_eff 的精度与基线持平而 ℓ-MoE_acc 的验证损失明显更低。因此研究推荐使用 ℓ-MoE_acc以实现精度与推理成本的帕累托最优。在更大参数量的模型训练中依旧可以得出同样的结论。推理性能实测推理性能表 5 是 LatentMoE 与标准 MoE 的实测推理吞吐对比验证 ℓ-MoE_acc论文推荐配置在真实部署中的推理效率。实测结果表明在高并发场景下单 GPU 吞吐的降幅最高仅为 6%。测试对象Hybrid-73BT-8BA 混合 Mamba - 注意力 MoE 模型硬件2 张 NVIDIA H100 GPU框架与精度vLLM 推理框架、FP8 逐张量量化LatentMoE 带来的精度提升幅度远大于 6% 的速度损失。并且通过进一步的软件优化甚至可以消弭 LatentMoE 与标准 MoE 之间这一微小的吞吐差距。万亿参数规模性能预估研究以公开的 Kimi-K2-1T 架构为理论基底构造了一个假想的 LatentMoE 变体理论预估等精度下推理的性能收益。LatentMoE 的核心优势是同成本下精度更高如果直接对比 “1T 参数标准 MoE vs 1T 参数 LatentMoE” 的速度是不公平的 —— 因为后者精度明显更高。因此论文采用了等精度基线法基于 Qwen-3 稠密模型的缩放定律计算模型精度对应的 “等效稠密参数量”。测算得到1T 参数的 Kimi-K2-1T-LatentMoE精度等价于1.35T 参数的标准 MoE 模型EPM≈1.35。构造一个标准 MoE 模型 Kimi-K2-1.35T把原生 1T 模型的层数从 61 层增加到 80 层让它的精度和 1T LatentMoE 完全对齐作为对比基准。图7说明1T LatentMoE 和 1T 原生标准 MoE 相比因为 LatentMoE 多了 down-proj/up-proj 两层投影引入了少量额外计算因此速度最多慢约 9%投影开销非常小。1T LatentMoE 和 1.35T 标准 MoE 相比精度完全对齐1T LatentMoE推理性能显著提升在解码为主的场景和预填充为主的场景下LatentMoE 始终处于更优的帕累托前沿。