标签

人工智能28:Transformer MoE架构演进全景深度解读

发布时间:2026-08-11 20:17阅读:3

当采用单层或多层网络同时学习多个子任务时,各子任务之间的梯度会产生相互冲突(interference),从而造成训练效率低下和泛化能力不足的问题。

因此1991年提出的MoE仍属于稠密计算模式——每个样本都会经过所有专家处理,仅在输出阶段进行加权融合。它最初的设计目标是解决"任务分工与抗干扰"问题,而非后来大家关注的"节省算力"。将"软加权"转变为"Top-K稀疏激活"则是2017年之后才出现的技术。

1994年,Jordan与Jacobs将其扩展为层次化MoE(树形结构,采用EM算法进行训练)

2017年,Shazeer等人在《Outrageously Large Neural Networks》中将MoE整合进LSTM,并引入了稀疏Top-K门控机制——仅激活少数专家参与计算,MoE由此从"抗干扰手段"转变为"扩容不增算力的核心武器"

2020年GShard → 2021年Switch Transformer → 2024年DeepSeekMoE:将专家模块替换为Transformer中的FFN子层

该研究首次将"多个独立专家+输入相关的门控网络+竞争式损失函数"三者有机结合,奠定了MoE范式的基础;但其本质仍是稠密软路由,设计的初衷是为了对抗任务干扰。当今大模型MoE所追求的"稀疏激活、降低FLOPs、细粒度切分"等特性,都是后来研究者在此框架基础上不断演进的结果。

维度

1991年(传统MoE)

2017年(稀疏化MoE)

门控方式

软门控(采用Softmax,全部专家参与加权)

稀疏门控(采用Top-K,仅激活K个专家,其余不参与计算)

算力消耗

全部专家均需前向传播,不节省FLOPs

仅计算K个专家,显著节省FLOPs

核心目标

缓解任务间干扰,改善学习效果

扩展总参数量,控制单样本计算量

专家协作方式

竞争式协作(通过竞争损失促使分工)

独立路由(门控决定哪些专家参与计算)

负载均衡机制

依赖竞争损失自动调节(效果有限)

必须显式添加辅助损失,否则会崩溃

损失函数设计

采用基于高斯混合模型的负对数似然

标准交叉熵结合辅助负载均衡损失

维度

1991年(传统MoE)

2017年(稀疏化MoE)

门控方式

软门控(采用Softmax,全部专家参与加权)

稀疏门控(采用Top-K,仅激活K个专家,其余不参与计算)

算力消耗

全部专家均需前向传播,不节省FLOPs

仅计算K个专家,显著节省FLOPs

核心目标

缓解任务间干扰,改善学习效果

扩展总参数量,控制单样本计算量

专家协作方式

竞争式协作(通过竞争损失促使分工)

独立路由(门控决定哪些专家参与计算)

负载均衡机制

依赖竞争损失自动调节(效果有限)

必须显式添加辅助损失,否则会崩溃

损失函数设计

采用基于高斯混合模型的负对数似然

标准交叉熵结合辅助负载均衡损失

这里先提前介绍一下,DeepSeekMoE论文的核心目标非常明确:在总专家参数量和单token激活算力均保持不变的前提下,仅通过调整结构设计,使每个路由专家尽可能实现"各司其职",达到极致的专家专业化水平。

组合空间呈指数级增长。举例说明:传统16个专家中选2个,组合数为C(16,2)=120;若切分为64个小专家、激活8个,组合数C(64,8)约为44亿。算力预算保持不变,但路由的"精细程度"提升了几个数量级。

每位专家能够更加专注于更狭窄的知识子集,专业化水平显著提升。

负载更加均衡:专家数量增多后,token在专家间的分布自然更为平滑。

共享专家不设门控权重(可理解为权重始终为1),所有token都会经过它处理;Router仅对路由专家进行选择。

模型名称

发布日期

总参数量

激活参数量

路由专家数量

共享专家数量

每token激活专家

DeepSeekMoE-16B

2024-01

16.4B

2.8B

64

2

8 (2个共享 + Top-6路由)

DeepSeek-V2

2024-05

236B

21B

160

2

DeepSeek-V3 / R1

2024-12 / 2025-01

671B

37B

256

1

8个路由 + 1个共享

DeepSeek-V3.2

2025-12

671B

37B

256

1

8个路由 + 1个共享

训练后期阶段(最后500B token),将偏置项的更新速率设为0,促使路由策略逐步稳定。

MLA(多头潜在注意力):将KV缓存压缩至低维潜在空间,推理时的显存占用显著降低(V2相比GQA减少了93.3%的KV缓存)。

FP8混合精度训练:核心计算采用8位浮点格式,训练效率大幅提升。

切细策略:N个大专家 → mN个小专家,组合空间从C(N,K)急剧膨胀至C(mN,mK)

共享机制:划分K_s个专家专门负责"通用知识存储",使路由专家能够实现极致专业化

两者结合后,每个路由专家所负责的知识领域几乎无重叠,这是"专家专业化"的理想状态

无辅助损失的负载均衡方案,同时兼顾均衡效果与模型性能

MLA + FP8 + MTP与MoE协同工作,将"节省计算"和"节省显存"两条优化路径同时打通

16B版本仅用40%的计算量即可达到7B稠密模型的性能水平

V3以5.5%的激活率驱动671B总参数,单次训练成本控制在557.6万美元

R1在V3的MoE基础上借助强化学习,实现了与OpenAI o1相当的推理能力

一个常见的误解需要澄清:MoE并非"免费的午餐"。它节省的是计算FLOPs,但总参数量实际上比同等效果的稠密模型更大,这导致显存和存储成本更高。因此MoE真正适用的场景是"云端大规模服务"——显存成本由服务提供商承担,用户则可享受较低的推理成本。在端侧或边缘部署场景下,经过蒸馏的稠密小模型反而更为合适。