热门搜索:和平精英 原神 街篮2 

您的位置:首页 > > 教程攻略 > ai资讯 >MoE to Dense介绍以及相关论文速览

MoE to Dense介绍以及相关论文速览

来源:互联网 更新时间:2026-08-01 14:26

背景

在推理算力不变的前提下,MoE模型依然能通过扩大规模来提升效果——听起来很诱人,对吧?但落到实际应用,这笔账就没那么简单了。

MoE to Dense介绍以及相关论文速览

首先,是推理性能的问题。MoE训练时,通信量的急剧增加是个硬伤,而且规模越大,这个瓶颈越明显。与激活参数相同的Dense网络相比,MoE的训练效率通常只有50%到80%。但在真实应用场景下,大家更关心的是推理性能。而MoE的推理性能严重依赖设备间的通讯带宽,这意味着部署成本会直线上升。

其次,是端侧应用的限制。MoE模型虽然激活参数少,但总参数量会暴涨数倍。在手机这类内存受限的环境里,这简直就是个灾难。虽然在服务端可以通过专家并行(EP)来缓解总参数量带来的压力,但终归不是长久之计。

正因如此,MoE to Dense的技术应运而生——直接把MoE模型转成一个彻底的Dense模型,上面的两个痛点自然就迎刃而解了。而且考虑到MoE的专家之间存在大量冗余,压缩总参数量的逻辑也就顺理成章了。

2篇相关论文

One Student Knows All Experts Know: From Sparse to Dense

National University of Singapore, Huawei, Oct 2022

总结:

作为最早提出将MoE能力压缩到Dense中的工作,华&为在MoE技术布局上的前瞻性可见一斑。结合其手机业务的应用场景,这项研究直指刚才提到的端侧部署难题。

论文提出了一个名为“知识收集”(knowledge gather)的任务,目标是把多个专家的知识合并到一个专家中,训练出一个与MoE效果相似的稠密学生模型。整个流程分为两步:知识收集和知识蒸馏。前者探索了四种不同的方法,后者则用整合好的知识进一步优化学生模型。实验结果表明,该方法在计算机视觉和自然语言处理两个领域都表现不错。

四种知识收集方法分别是:求和(summation)、平均(a veraging)、Top-K知识收集(Top-KG)和奇异值分解知识收集(SVD-KG)。前两种类似于简单的参数合并,后两种则是论文的原创,致力于提取关键参数。但无论哪种方法,合并过程都难免引入噪声,所以下一步的蒸馏就成了恢复模型能力的关键。

论文的核心创新点其实在知识收集这一步,按理说应该重点验证不同收集方法的效果。可惜的是,实验结果并未充分证明这一点。MoE to Dense应用的一个关键要求是低成本迁移,但论文并未说明第二阶段蒸馏所需的计算量,而是直接将蒸馏后的最终效果与传统方法对比。

Experts Weights A veraging: A New General Training Scheme for Vision Transformers

Aug 2023, Fudan University

重参数化(re-parameterization)在CV领域并不新鲜,比如ResNet的多分支结构虽然在训练时有效,但推理效率低下。RepVGG的解决方案是训练时用多分支,推理时通过卷积核合并成单分支网络。关键在于合并后的结构等价性,而MoE的专家之间并不存在这种等价合并方式。

为了解决这个问题,论文在每次训练后人为拉近专家之间的参数距离。方法如下:

这个做法有个潜在隐患:MoE的训练过程本身是鼓励专家之间差异化的,如果人为对参数进行平滑,会不会反而降低了MoE的效果?

训练结束后,通过平均每个MoE的专家,将其转换为FFN,最终把模型还原成原始ViT进行推理。论文还提供了理论分析,证明该方法的有效性和通用性,并在多种2D、3D视觉任务、ViT架构和数据集上做了大量实验。

这篇文章的巧妙之处在于,借助MoE与重参数化的结合,既提升了ViT的效果,又降低了MoE模型的部署难度。确实是一个值得借鉴的思路。

后记

坦白说,MoE to Dense并不是一个高频需求,上述两篇论文的应用场景多少都有些推理资源敏感。但我的判断是,随着MoE模型越做越大,推理压力只会越来越重。虽然专家并行能缓解一部分压力,但要达到与同激活参数Dense模型一样的推理效率,难度相当大。从这个角度看,MoE to Dense的价值将持续增长。

此外,MoE中必然存在大量冗余信息,这一点可以从两个现象中看出端倪:第一,增加激活专家数量并不会带来明显的效果提升;第二,无论用什么方法训练,总有一些专家被激活的比例很低。因此,对MoE进行裁剪是必经之路,而无论是裁剪还是转换为Dense模型,前提都是要搞清楚MoE的参数特性。

这个方向的挑战也不少,举两个关键点:

  1. 目前MoE架构正朝着DeepSeek提出的Fine-Grained + Shared Expert方向发展,这给MoE to Dense的转换增加了难度。既要保证转换方法的有效性,还要兼顾模型结构的适配。
  2. 还有一个隐形收益:通过验证不同转换方案,能获取不少关于MoE技术内在机制的洞见。但再往深处走,就要触及模型参数的可解释性了——那可是个更复杂的领域。
关于宇宙的好的网名有哪些
关于宇宙的好的网名有哪些

类型:角色扮演

大小:1

语言:简体中文

平台:互联网

游戏下载

热门手游

手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc