热门搜索:和平精英 原神 街篮2 

您的位置:首页 > > 教程攻略 > ai资讯 >如何理解和探索大模型的多语言能力?

如何理解和探索大模型的多语言能力?

来源:互联网 更新时间:2026-08-23 13:44

(本文阅读时间:7分钟)


大语言模型在未使用多语言平行语料库进行预训练的情况下,依然展现出了令人瞩目的多语言能力。但一个问题随之而来:这些模型处理多语言文本的底层机制究竟是什么?这至今仍是一个极具挑战性的问题。微软亚洲研究院联合中国人民大学,提出了语言激活概率熵这一新方法,专门用于识别大模型中的语言特定神经元。这项研究为理解大模型的多语言能力提供了关键线索,成果已被自然语言处理领域国际顶级学术会议 ACL 2024 收录。


全球超过7000种语言,想打破语言壁垒、促进知识交流,提升机器的多语言能力一直是学术界和工业界的核心目标。mBERT 和 XLM-R 等预训练语言模型的问世,标志着大模型在多语言理解上迈出了一大步。尤其值得关注的是,尽管 GPT-4 和 PaLM-2 主要基于英语语料库训练,但它们仍然在语言理解、推理和生成上展现出极强的多语言能力。


现有研究大多聚焦于多语言预训练模型,探究它们如何在没有平行语料库的情况下实现跨语言语义对齐,但对模型内部处理不同语言的机制探讨并不多。为了填补这个空白,微软亚洲研究院与中国人民大学合作,借鉴神经生物学对人类语言能力的研究思路,系统研究了语言特定神经元的识别、分布以及语义空间映射机理。实验证实,语言特定神经元真实存在于大语言模型中,并且直接影响着模型的多语言能力。相关论文已被 ACL 2024 接收。


Language-Specific Neurons: The Key to Multilingual Capabilities in Large Language Models


论文链接:
https://arxiv.org/abs/2402.16438


参考人脑中支持特定语言功能的区域(如布罗卡区和韦尼克区),研究员们假设大模型内部也可以分为两个部分:一部分是语言无关区域,负责通用知识和语用原则;另一部分是语言特定区域,负责处理特定语言的词汇、语法和习语表达。图1展示了这一假设的模型区域概念图。既然语言无关区域已有大量研究,这次将重点锚定在语言特定区域,特别是支持多语言能力的部分。


图1:模型处理语义相同但语言不通的文本时,内部神经元的激活情况


LAPE:使用语言激活概率熵识别语言特定神经元


如何精准定位这些语言特定神经元?研究员们提出了一种新颖的检测方法——语言激活概率熵(Language Activation Probability Entropy,LAPE)。流程是这样的:先统计每个神经元对不同语言文本的激活概率,然后挑选出概率分布熵较低的神经元——也就是那些对一两种特定语言有较高激活概率,对其他语言激活概率明显偏低的神经元。


具体实现上,现有大模型都基于 Transformer 架构,由多头注意层和前馈网络层堆叠而成,每个前馈网络层又包含若干神经元。按照常规定义,神经元输出值大于0则视为被激活。对于第 i 层的第 j 个神经元,研究员们将其在语言 k 的大量文本上的激活概率计算为:


(公式一)


其中 h̃^i 是隐藏层状态,W_l^i 和 act_fn 分别是前馈网络层的参数矩阵和激活函数。由此得到每个神经元在不同语言上的激活概率分布。经过 L1 归一化后,计算其信息熵——也就是语言激活概率熵,用来量化每个神经元的激活反应:


(公式二)


LAPE 分数较低的神经元就被视为语言特定神经元,因为它们倾向于只对一两个语言有较高激活概率,而对其他语言激活概率较低。


8个大模型测试:神经元失活影响大模型多语言能力


为了验证方法的有效性,研究员们基于英文、中文、法语、西班牙语、越南语、印度尼西亚语和日语的维基百科数据,选取神经元总量的1%作为语言特定神经元,并在 LLaMA-2、BLOOM、OPT、Mistral、Phi-2 等开源大模型上进行了测试。


图2展示了 LAPE 方法在8个模型上的表现。每个子图的第 i 行第 j 列代表失活语言 i 的神经元对语言 j 建模的 PPL 变化,PPL 变化越大说明影响越明显。可以清晰看到,8个图都展现出了明显的“对角化”现象:失活某语言的神经元,对该语言的建模能力影响显著,但对其他语言影响较小。这完全符合语言特定神经元的初衷,也证实了 LAPE 方法的有效性。而且无论模型大小(7B、13B、70B)还是类型(LLaMA-2、BLOOM、OPT、Mistral、Phi-2),LAPE 方法都表现稳定,通用性很强。


图2:失活语言特定神经元对模型多语言能力的影响


图3展示了一个具体案例。研究员们用简体中文提问 LLaMA-2(70B)模型,然后让其在简体中文神经元失活的情况下回答。结果对比很直观:正常回答流畅准确,但失活后回答里混入了大量繁体中文和重复的英文短语,说明简体中文生成能力明显下降了。


图3:失活简体中文神经元后,LLaMA-2(70B)的回答


最后,研究员们还分析了语言特定神经元的层间分布。从图4可以发现,这些神经元高度集中在模型的底层和顶层。具体来看,第2层大约有7000个语言特定神经元,而第5至47层每层只有大约100个,模型的最后4层每层也都有超过1000个语言特定神经元。


图4:LLaMA-2(70B)语言特定神经元的层间分布


为了进一步解释这个现象,研究员们使用了语言不同但语义相同的文本,计算这些平行语料的句向量在模型不同层的距离。图5显示,不同语言的向量一开始距离较远,经过底层处理后迅速靠近达到顶峰,然后在顶层距离又很快下降。这一趋势与语言特定神经元的分布高度一致。由此可以推测:大模型的底层负责将不同语言的文本映射到同一个语义空间,所以需要大量语言特定神经元;中间层对统一的语义空间进行相似处理,所需语言神经元较少;最后顶层需要将语义映射回各自的语言进行生成,因而再次需要大量语言神经元。


图5:平行语料在不同语言间平均句向量距离的层间分布


综上所述,语言特定神经元在大语言模型中真实存在,并且直接影响着模型的多语言能力。这项研究提出的语言激活概率熵方法可以有效识别模型中的语言特定神经元。未来,微软亚洲研究院的研究员们将继续探索语言与语义的对齐关系、多语言模型的高效训练与调试方法,以及一致性和安全性等课题,努力推动大模型多语言能力的进一步提升。

关于宇宙的好的网名有哪些
关于宇宙的好的网名有哪些

类型:角色扮演

大小:1

语言:简体中文

平台:互联网

游戏下载

手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc