来源:互联网 更新时间:2026-08-02 13:11

有一天,请来最熟悉的大语言模型帮忙,让它用四岁孩子能懂的方式解释“向量”。几秒钟后,一个充满神话生物、魔法和向量的故事就诞生了——主角是一只名叫“LuminaVec”的独角兽,而听起来像是一本新的儿童绘本草图已经成形。图片由作者提供(“LuminaVec”正由快四岁的孩子阅读)。
这个大语言模型是怎么创造出这种创意魔力的呢?答案就是向量,更准确地说,是向量数据库。接下来,我们一步步拆解背后的原理。
首先,模型本身并不理解输入的那些有意义的单词。真正起作用的是这些单词的数字表示——向量,它们为单词提供了
嵌入中的向量,本质上是某个对象相对于参考空间的位置数值列表。这些对象可以是数据集中的特征变量。有了这些向量分数,就能判断一个特征与另一个特征的距离——它们是相似(靠近)还是不相似(远离)。
向量的威力很大,但处理大语言模型时必须小心——因为“大”这个字很关键。在那些“大型”模型里,向量可能迅速变得又长又复杂,动辄涵盖数百甚至数千个维度。如果处理不当,计算速度和存储开销会很快变成棘手问题。
针对这个痛点,我们有强大的武器:向量数据库。
回到彩虹独角兽和闪闪发光的魔法故事——当向模型发出那个请求时,它大致经历了这样几步:
想更具体一点?不如直接上手走一遍流程,重温基础。感谢Tom Yeh教授,他有一篇精彩的文章揭示了向量数据库的幕后工作原理。(以下所有图片,除非特别说明,均来自Tom Yeh教授的LinkedIn帖子,经许可后编辑使用。)
用一个简单示例开始:数据集包含三个句子,每个句子有三个单词(或token)。
我们的查询是“am I you”。
在真实场景中,数据集可能包含数亿条(比如维基百科、新闻档案、论文合集等),而最大token数量也可能达到数万。舞台已搭好,流程如下:
通过查表,单词“how are you”的词嵌入如下所示:
快速回顾:
线性变换
ReLU激活函数
因此,此示例的文本嵌入如下所示:
为展示计算过程,以最后一列为例:
这样就得到了特征处理的最后一列。对其他列重复相同步骤。
至此,已对数据集完成索引。接下来执行实际查询,看看索引如何发挥作用。
[6] 首先,对查询重复上述步骤——嵌入、编码、索引,得到其二维向量表示。
[7]
[8]
至此,整个优雅的流程结束。通过利用向量数据库中数据集的向量嵌入,并执行上述步骤,能够找到最接近查询语句的句子。嵌入、编码、均值池化、索引和点积构成了该过程的核心。
然而,当回到“大”的视角:
当所有这些数据和步骤叠加在一起,实际上是在一个猛犸象般规模的维度上执行操作。为了应对如此巨大的规模,向量数据库的重要性就凸显了。既然从大语言模型开始讨论,就可以说:正是由于向量数据库的规模处理能力,它们在检索增强生成(RAG)中扮演了关键角色。向量数据库提供的可扩展性和速度,使RAG模型能高效检索,从而为高效的生成模型铺平道路。
总而言之,向量数据库的威力毋庸置疑。它们已存在多年——最初用于推荐系统,如今为大语言模型提供动力,统治仍在继续。随着不同AI模式的向量嵌入不断增长,向量数据库似乎还会在未来很长一段时间内延续它的统治!
ThinkBook系列最新价格全解析:2026年选购避坑与实时询价指南
Ondo将于今日上线股票永续合约
暗黑4S14野蛮人终局BD攻略
区块链OTC交易所有哪几家比较正规?
Binance新增15种bStocks代币化证券为杠杆抵押资产
Meme币DOGS今晚上线!开局就解锁91%代币是否带来风险?
忍者必须死3极刃血影角色介绍
晶核艾尔莎角色盘点 晶核艾尔莎强度分析与实战表现
余姚的路虎4s店在哪个位置
彩云天气怎么看分钟级降雨预报 彩云天气精准预报方法【技巧】
五千元以下的笔记本几乎消失!经销商:至少一年看不到涨价尽头
Intel喜讯连连:18A工艺良率提升到85%、CPU将涨价15%
遗忘之海密室通关教程 遗忘之海密室全关卡解谜思路与难点解析
华为Mate 70系列首发的红枫镜头下放至千元档:全员普及原色影像
合集38个项目筹集5.406亿美元 Figure融资2亿
国家养老服务消费补贴上线京东
英伟达机器人团队在京沪深招人,聚焦具身智能等四大领域
一站式PDF转Markdown解决方案PDF3MD
硬刚苹果!华为9月新品阵容出炉:Mate 90系列、全新三折叠
微软Copilot AI漏洞可致敏感数据泄露,企业用户需及时更新
手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc