来源:互联网 更新时间:2026-07-31 14:02
大语言模型训练过程中的一个核心挑战,就是如何让网络稳定地收敛。尤其是面对NLP领域这种序列长度不一的样本,归一化(Normalization)操作就显得格外关键。这和计算机视觉(CV)领域那套方法有很大区别,CV里的归一化(比如BatchNorm)在NLP场景下常常水土不服。
长话短说,在LLM的世界里,归一化方法大致可以分为几大派别:LayerNorm、BatchNorm、RMSNorm和DeepNorm。
当然,我们还可以从归一化在Transformer结构中的
BatchNorm的思路,是在一个batch内,对数据的某个特定维度进行归一化。这在图像处理领域是绝对的主力,因为图像数据维度固定,且batch内的样本性质一致。但把它直接搬到NLP,就有些尴尬了。序列数据的长度是不固定的,在batch这个维度上计算均值和方差,意义不大,甚至会引入不必要的噪声。
可以说,LayerNorm是专门为序列数据量身定做的解决方案。它的核心思想,是对
有时候面试会要求手撕公式,所以还是得熟悉一下。核心公式大致如下:

经过归一化后的激活值,就变成了这样:

RMSNorm的出现,是为了解决LayerNorm在训练时的效率问题。你可以把它看作是LayerNorm的一个“轻量版”兄弟。关键区别在于归一化的方式:LayerNorm同时使用了均值和方差,而
公式上,它就像这样:

归一化后的值如下:

可以看到,LayerNorm包含“缩放”和“平移”两个步骤,而RMSNorm去掉了“平移”部分,只保留了“缩放”。这么做的理论依据在于,有研究指出,LayerNorm能够成功的关键,是缩放操作带来的缩放不变性,而非平移不变性。去掉平移,计算量自然就降下来了,训练速度更快,而最终效果不仅没打折扣,往往还能有所提升。
DeepNorm是微软推出的一种归一化方法,它主要针对Transformer结构中的残差连接进行了修正。我们知道,当模型层数变得非常深(比如1000层)时,参数更新很容易出现“爆炸式”增长。DeepNorm的目标,就是把这个更新幅度限制在一个稳定的常数范围内。
它的实现思路很巧妙:在LayerNorm之前,对残差连接进行“上标度”(up-scale),同时在初始化阶段对模型参数进行“下标度”(down-scale)。这样一来,既兼顾了PreLN在浅层训练时的稳定性,又想达到PostLN在深层模型上的表现。著名的GLM-130B模型中,就采用了DeepNorm。

在最初的Transformer架构中,采用的是PostLN结构——也就是在残差连接

与PostLN相反,PreLN将LayerNorm放在残差连接的
摩托车活塞环性能如何
ThinkBook系列最新价格全解析:2026年选购避坑与实时询价指南
Ondo将于今日上线股票永续合约
暗黑4S14野蛮人终局BD攻略
区块链OTC交易所有哪几家比较正规?
Binance新增15种bStocks代币化证券为杠杆抵押资产
货拉拉如何查看历史订单 货拉拉往期行程轨迹查询【功能教学】
Meme币DOGS今晚上线!开局就解锁91%代币是否带来风险?
晶核艾尔莎角色盘点 晶核艾尔莎强度分析与实战表现
剑侠世界3雪峰论剑怎么打-剑侠世界3雪峰论剑打法介绍
五千元以下的笔记本几乎消失!经销商:至少一年看不到涨价尽头
Intel喜讯连连:18A工艺良率提升到85%、CPU将涨价15%
今日小鸡庄园答案2026.7.2
美债股纳斯达克首盘暴跌38%且加密代理交易解体,AVAX价格何去何从?
男生头像配网名可爱(精选100个)
赵云与阿斗神兵符使用教程 神兵符怎么使用
国家养老服务消费补贴上线京东
余姚的路虎4s店在哪个位置
英伟达机器人团队在京沪深招人,聚焦具身智能等四大领域
一站式PDF转Markdown解决方案PDF3MD
手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc