来源:互联网 更新时间:2026-08-17 14:22
上回咱们聊了token是什么,以及词表是如何构建、句子是怎么被切分的。但有个关键问题悬而未决:计算机究竟是如何“理解”这些token的?它们又是怎样参与到复杂的数学计算中去的?
今天,我们就来把这个问题讲透。本文会围绕三块内容展开:
要让计算机处理文本,首先得把文字变成数字。这事儿听着简单,做起来却有不少门道。
最直白的方法莫过于One-Hot编码。想象一下,你的词表里有一万个词,那么每个词就被表示成一个一万维的向量。这个词在自己对应的位置上标为1,其他9999个位置全是0。
举个例子,假设我们从两句话里得到一个微型词表:
那么词表就是:[我, 爱, 人工智能, 中国]。句子“我 爱 中国”里的三个token,就可以用下面这个表来表示:
| 我 |
爱 | 人工智能 | 中国 |
|
| 我 |
1 | 0 | 0 | 0 |
| 爱 |
0 |
1 |
0 | 0 |
| 中国 | 0 |
0 | 0 |
1 |
这种方法的优点很明显:
显然,对于需要理解复杂语义的大模型来说,One-Hot编码远远不够。
于是,更聪明的办法出现了:稠密向量编码,也叫词嵌入(Word Embedding)。
思路很简单:我们不再用超长的稀疏向量,而是为每个词分配一个固定长度的、稠密的短向量,比如128维或256维。这个向量里的每个数字都不是0或1,而是一个连续的实数,例如“(0.21, -0.15, 0.64, 0.36)”。
这样一来,不管词表多大,每个词的表示维度是固定的,极大地压缩了空间。更重要的是,这些稠密向量不是随机给的,而是通过在海量文本上训练得到的。训练的目标是让语义相近的词(如“国王”和“王后”),其向量在空间中的距离也更近。
Word2Vec、GloVe等都是早期非常成功的词嵌入训练方法。它们带来的好处是革命性的:
不过,它也有自己的局限:训练成本高、更新词表麻烦、向量的可解释性较差(很难说清某一维具体代表什么含义)。
如今的大语言模型,本质上沿用了稠密向量编码的思想,但把它做成了模型内在的、可学习的一部分。
具体来说,模型初始化时,会创建一个巨大的“词嵌入矩阵”。这个矩阵的行数就是词表大小(比如15万),列数就是设定的向量维度(比如4096)。矩阵中的每一行,都对应词表里一个token的稠密向量表示。
在模型运行时,输入句子被切分成token后,每个token根据其在词表中的索引,去这个矩阵里“查表”,取出对应的行向量。这个稠密的数值向量,就是计算机真正用来“理解”和计算该token的表示。
接下来的故事就顺理成章了:这些向量经过模型中层层叠叠的神经网络(主要是Transformer模块)进行复杂的加法和乘法运算。最终,模型会输出一个向量,这个向量会与词嵌入矩阵中的每一行进行计算(比如点积),衡量相似度。相似度最高的那些行所对应的token,就会以较高概率被选为模型的输出。
而我们常说的调节生成效果的参数,如top_k、top_p,其实就是在这个选择概率的环节上施加约束和控制。
理论讲完了,咱们看个实例。这是Qwen-7B模型配置文件里关于词表的部分关键参数:
{
"vocab_size": 151646,
"hidden_size": 3584,
...
}
这里有两个关键数字:
vocab_size: 151646:词表大小,约15.2万个token。hidden_size: 3584:隐藏层维度,在这里也即是每个token嵌入向量的维度。我们来算一笔账:整个词嵌入矩阵的参数总量 = 151646 * 3584 ≈
要知道,Qwen-7B模型总参数才约70亿,光是这个词表就占用了超过5.4亿参数,占比接近8%!如果用FP16精度加载,光这个词嵌入矩阵就要吃掉超过1GB的显存。在大规模分布式训练中,如何高效地管理和优化这部分巨大的参数,本身就是一个非常关键的工程问题。
至此,我们从数字上理解了token是如何被表示的。但这只是万&里长征第一步。接下来,这些稠密的向量将走入大模型的核心——注意力机制(Attention),在那里上演真正精彩的交互与融合。我们将在下一篇文章中,揭开Attention的神秘面纱,看看它到底是什么,又包含了多少参数。
腾讯ima怎么把微信内容一键导入知识库?
黄金价格不断创新高!黄金稳定币XAU、PAXG市值达11亿美元
CC币价格预测(2026-2035):Canton币今日价格走势+长期价格预测
新浪互联网热点小时报丨2026年07月26日16时_今日实时互联网热点速递
腾讯ima怎么创建共享知识库?
2026鸣潮账号交易安全指南:五大交易平台对比与风险避坑分析
今日比特币暴涨分析:Metaplanet的比特币BTC投资推动股价上涨17%
新浪机器学习热点小时报丨2026年07月25日18时_今日实时机器学习热点速递
新浪人工智能热点小时报丨2026年07月30日18时_今日实时人工智能热点速递
比特币(BTC)核心周期指标复刻历史走势 价格或跌破5.8万美元关键支撑位
蚂蚁庄园今日答案7月21日(今日已更新) 蚂蚁庄园今天正确答案是什么呢
Celestia价格预测2026-2032:TIA币能否引领山寨币上涨行情?历史价格回顾
2026年三角洲行动账号交易指南:5大交易平台对比与安全选购建议
Windy卫星云图怎么看?云层变化识别技巧
TRUMP价格走势与WEPE预售进展解析
kimi提示词专家使用方法新手指南
抖音怎么取消申请退货退款?抖音上取消退货怎么操作
WorkBuddy登录后怎么查看积分?
一加手机如何设置三指长按屏幕局部截图
短剧《仙人跳获透视,古玩玉器我全拿捏》剧情介绍
手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc