人工智能28:Transformer MoE架构演进全景深度解读
当采用单层或多层网络同时学习多个子任务时,各子任务之间的梯度会产生相互冲突(interference),从而造成训练效率低下和泛化能力不足的问题。因此1991年提出的MoE仍属于稠密计算模式——每个样本都会经过所有专家处理,仅在输出阶段进行加权融合。它最初的设计目标是解决"任务分工与抗干扰"问题,而非后来大家关注的"节省算力"。将"软加权"转变为"Top-K稀疏激活"则是2017年之后才出现的技术。1994年,Jordan与Jacobs将其扩展为层次化MoE(树形结构,采用EM算法进行训练)2017年,S