热门搜索:和平精英 原神 街篮2 

您的位置:首页 > > 教程攻略 > ai资讯 >一文彻底搞懂Transformer - 注意力机制

一文彻底搞懂Transformer - 注意力机制

来源:互联网 更新时间:2026-08-17 14:23

在深入Transformer之前,得先搞明白它最核心的部件——注意力机制。这东西听起来玄乎,其实背后的逻辑挺直白:就是让模型在处理一串东西(比如一句话)时,别只顾着最后一个词,而是能回头看,知道哪里更重要。

一、注意力机制

一文彻底搞懂Transformer - 注意力机制

注意力机制背景

:最初的Seq2Seq模型有个硬伤——编码器这边,最后一个神经元的隐状态要扛起整句话的所有信息,然后传给解码器。这好比让一个人记住整本书然后口述,信息必然有丢失。这就是所谓的“信息瓶颈”。

注意力机制目标

:说白了,就是要打破这个瓶颈。让模型在处理序列时,能动态地给不同位置分配权重,捡重要的看、不重要的少看。这样一来,长序列中的关键信息就不会被漏掉。

Transformer注意力机制

:当嵌入向量进入Attention模块后,模块会通过Q、K、V这三个“探针”计算注意力权重,让向量之间相互“对话”,并根据彼此的关联更新自身的表示。核心任务就是判断在当前上下文中哪些向量最相关,然后据此调整。

注意力机制案例

:比如句子里有“model”这个词,旁边跟着“machine learning”还是“fashion”,模型会通过计算它们之间的语义关系权重,来重新理解“model”到底指“模型”还是“模特”。这才是真正的上下文感知。

二、注意力机制工作流程

注意力机制计算公式

:简单说,就是Q(查询)和K(键)先算个点积,得出相似度分数,然后用Softmax归一化成权重,最后拿着这堆权重去加权求和V(值),输出就是融合了上下文的新表示。整个过程可以用一个公式概括。

注意力机制计算公式

注意力机制计算Q、K、V

:具体分四步走——

  • 生成Q、K、V向量

    :输入序列的每个单词,都通过一个线性变换层,从嵌入向量映射出属于自己的Query、Key和Value。
  • 计算Q、K点积(注意力分数)

    :把Query和所有Key的内积算出来,分数越高说明关联越紧密。
  • Softmax归一化(注意力权重)

    :对分数做Softmax,让它们变成总和为1的权重,代表每个位置该被“关注”多少。
  • 加权求和(加权和向量)

    :用这些权重去乘对应的Value,然后加起来。得到的新向量就是当前位置吸收了全局信息后的表示。

注意力机制计算Q、K、V

三、3种注意力机制

Transformer架构里,注意力层不是只有一个版本,而是根据位置和用途分成了三种。

编码器中的自注意力层

:在编码器里,所有的Q、K、V都来自同一个地方——前一层的输出。所以每个位置都能看到前一层所有其他位置的信息,实现“全局互看”。编码器输入序列通过Multi-Head Self Attention(多头自注意力)完成这一步。

编码器的Self Attention

解码器中的交叉注意力层

:解码器这边,Query来自解码器自身的前一层,而Key和Value则来自编码器的输出。这就让解码器在生成每一个词时,都能“回头”去关注整个输入序列,对齐源语言和目标语言的信息。这就是Multi-Head Cross Attention(多头交叉注意力)。

编码器-解码器的Cross Attention

解码器中的因果自注意力层

:解码器内部还有一个特殊的自注意力层——它只允许当前位置看到它自己以及它左侧(之前)的位置,绝不允许看到未来的词。为了保持自回归特性(即每个词的生成只依赖已生成的内容),需要把未来位置的分数在Softmax之前全部设成负无穷,也就是“掩盖”掉。这层叫做Multi-Head Causal Self Attention(多头因果自注意力)。

解码器的Causal Attention

神经网络算法 - 一文搞懂Transformer中的三种注意力机制

关于宇宙的好的网名有哪些
关于宇宙的好的网名有哪些

类型:角色扮演

大小:1

语言:简体中文

平台:互联网

游戏下载

热门手游

手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc