来源:互联网 更新时间:2026-08-27 14:22
MoE结构现在成了大模型领域的香饽饽,但要真正用好它,不少细节值得深究。最近看到一份61页的详细报告,信息量很大,里面有不少跟直觉不太一样的发现,挑几个有意思的跟大家聊聊。
先从性能说起。1B到7B规模的MoE模型与同等规模的Dense模型相比,起点明显更高,而且训练到后期,性能甚至能接近甚至超过7B的全量全参数Dense模型。这个结论相当直接,效果对比图也印证了这一点。

在专家组合的设计上,研究发现采用更细粒度的专家组合,确实能带来更低的训练损失,但收益是递减的。报告中还引用了不少相关研究,都在尝试预测最优的专家组合方式。

一个比较反直觉的结论是关于共享专家的。报告指出,共享专家会消除模型的灵活性,反而导致性能下降。这跟一些历史研究结论不太一致,值得关注。
在路由策略上,也就是如何决定每个输入token由哪些专家处理,主要存在两种方案:一种是EC(每个专家从输入序列中固定选择token数),另一种是TC(每个token固定选择若干个专家)。EC方式的优点是能完美实现负载平衡,但不适合自回归生成模式,还可能导致token丢失。而TC方式的问题是,许多token可能都选择同一个专家,影响训练效率。不过在相同预算下,实验结果显示TC稳定优于EC。
关于专家的初始化方式,是从头开始训练还是从MLP复制参数?实验表明,只需要几百B的训练数据,从头初始化的模型就能赶上复制参数的结果。而在超过600B的token后,从头训练的专家表现甚至反超了复制的版本。
负载平衡损失的应用也被证实能带来更好的性能。此外,路由z-loss这项技术值得留意——它通过惩罚进入门控网络的大logits值,能有效提升MoE模型的稳定性和质量。
还有几个训练过程中的现象很有意思。比如,在预训练的早期阶段,路由就已经达到了饱和状态。而训练结束后,同一层的专家之间并不存在强协同激活,也就是说不同专家之间几乎没有冗余。
最后,关于专家的专业化分工,报告发现区分度还是比较高的。有些专家专门处理科学相关的数据(比如arXiv数据集),另一些则更擅长编程语言或一般文本。这种专业化分工,恰恰是MoE结构能够高效处理多种任务的关键所在。
ELON币发展前景怎么样?未来潜力如何?ELON价格走势分析
黄金和比特币走势是相反吗?黄金和比特币哪个价值高?
豆包app正版免费版下载 豆包安卓正版安装包下载
55部泰腐剧全盘点,从《千星传说》到《以你的心诠释我的爱》
豆包app官方下载 豆包官方免费下载安装
LITH币可以长期持有吗?LITH币价格最新行情
电视剧《温柔的谎言》剧情介绍
CCTV-1黄金档《藏锋》今晚首播!
2026暑期档票房破100亿:《功夫女足》《八仙!》TOP2
石头P30 Pro发布:8.98cm超薄热活水扫拖机器人
vivo手机怎么设置来电闪光灯 vivo手机来电提醒设置教程
盘搜搜搜索入口地址 盘搜搜网盘资源在线查找入口
短剧《我本无念,奈何我有神之眼》剧情介绍
三款26年75寸Mini LED 电视横评|创维 A7H
短剧《云端负烟火》剧情介绍
2026磁轴键盘超短触发选购指南
iPhone 18支持多少瓦快充 苹果18选购适配器充电器推荐
电视剧《她的罪名》剧情介绍
闺蜜网名高冷女生(精选100个)
短剧《谁敢动我的家人》剧情介绍
手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc