Kimi K3:896位专家如何重塑超大规模语言模型

解构 Kimi K3:896 个专家背后的技术抉择
随着模型规模的扩展,超大规模语言模型的训练正面临越来越复杂的技术挑战。Kimi K3 的设计尤其值得关注:它不仅拥有 2.8 万亿的总参数,还引入了多达 896 个路由专家的混合专家架构(Mixture of Experts, MoE)。近日,知名研究员苏剑林通过一篇详细的复盘文章,揭示了 Kimi K3 在专家架构、训练稳定性、负载均衡和注意力机制上的诸多关键取舍。
K3 的核心设计目标显而易见:在追求模型能力提升的同时,尽量避免计算成本的线性增长。要实现这一目标,研究团队需要在专家计算、跨设备通信和注意力机制等多个层面找到平衡点。以下,我们将从这些关键技术点出发,拆解 K3 的技术创新。
1. LatentMoE:更高效的专家分配策略

传统的 MoE 架构通过路由器(Router)为每个输入 Token 分配少数几个专家,从而避免激活所有专家而导致计算资源的浪费。然而,随着专家数量的增加,通信成本迅速成为瓶颈:每个 Token 的隐藏状态需要被分发到不同的 GPU 上,而这种跨设备通信常常比矩阵计算更耗费资源。
K3 的 LatentMoE 提供了一种全新的解决方案:先将 Token 的高维隐藏状态压缩到一个更窄的潜在空间,仅在这个压缩空间中进行专家计算,最后再恢复到原始维度。例如,K3 的主隐藏维度为 7168,而路由专家的计算则限制在 3584 的潜在维度中。这种降维设计显著减少了专家计算量和跨设备通信的数据量。
更重要的是,LatentMoE 不仅降低了单次计算的开销,还为专家池的规模扩展创造了可能。K3 的专家数量因此从传统的 448 扩展到 896,同时每个 Token 激活的专家数量也从 8 增加到 16。更多的专家参与计算,使模型能够实现更细致的能力分工,提高整体效率。
然而,潜在空间的引入并非全无代价。维度的压缩意味着信息损失的风险,因此 K3 还保留了 2 个共享专家,专门处理基础语义和通用推理任务,而路由专家则聚焦于更细化的能力。这种分工避免了过多专家重复承担同样的任务,同时最大化了计算资源的利用率。
2. 稳定性挑战:数值波动与负载均衡
LatentMoE 的引入虽然带来了性能提升,但也增加了训练路径的复杂性。降维、专家计算和升维等步骤的叠加,使得数值波动更容易被放大。同时,路由器在分配 Token 时,也可能导致部分专家过载,进一步影响训练稳定性。
为了应对这些挑战,K3 引入了一系列机制,构建了所谓的 Stable LatentMoE:
- RMSNorm 校准:每个专家分支输出的结果,经过路由器权重聚合后可能尺度不一致。RMSNorm 在每次升维之前统一校准这些尺度,避免波动扩散到主干网络。
- SiTU-GLU 激活函数:传统激活函数在 MoE 环境下容易出现异常激活,特别是低精度计算(如 BF16 或 FP8)中。SiTU-GLU 在设计上更稳定,有效减少了数值异常。
- Quantile Balancing:为了解决负载不均的问题,K3 使用了一种新的量化平衡机制,确保近千个专家的使用率更加均匀,减少了少数专家持续被过载调用的风险。
这些措施确保了 K3 在扩展规模的同时,能够维持高度稳定的训练过程。
3. 混合注意力:应对长上下文的处理瓶颈

在注意力机制的设计上,K3 同样做出了有趣的选择。随着上下文长度的增加,注意力计算的成本会呈现二次方增长,而 KV Cache 的存储需求同样激增。为了解决这个问题,K3 并未采用单一的注意力方案,而是交替使用了 KDA(Kernelized Dot-product Attention)和 Gated MLA(Multi-head Linear Attention)。
- KDA 提供了更高效的点积注意力计算,适合处理短距离依赖。
- Gated MLA 则通过线性注意力的方式降低了长距离计算的开销。
这种混合使用的策略,能够动态分配不同层的计算资源,使得模型在长上下文处理时既具备高效性,又不丧失准确性。此外,K3 还采用 NoPE MLA(没有位置编码的线性注意力)进一步优化了长距离记忆的占用,使得模型能够处理更长的上下文,而不会显著增加存储和计算负担。
影响与展望
Kimi K3 的技术创新展示了一种在超大规模模型领域的全新思路:规模扩展可以带来能力的提升,但关键在于如何控制住计算和通信成本。通过 LatentMoE 的降维策略,Stable LatentMoE 的数值稳定性设计,以及混合注意力机制的优化,K3 为超大模型的训练与部署提供了宝贵的经验。
然而,K3 的设计仍然面临挑战。比如,尽管 Quantile Balancing 改善了负载均衡,但在实际部署中,分布式系统的通信延迟可能依然是一个瓶颈。此外,随着更多低精度格式(如 FP8)的普及,如何在性能和稳定性之间找到平衡点,也将成为未来研究的重要方向。
总的来说,Kimi K3 的探索不仅推动了 MoE 架构的技术边界,也为整个行业提供了一个重要的参考:超大模型的未来不只是“更大”,而是“更聪明地变大”。
标签: 超大规模语言模型 MoE架构 注意力机制 人工智能 模型优化