热门搜索:和平精英 原神 街篮2 

您的位置:首页 > > 教程攻略 > ai资讯 >大模型开发 - 一文搞懂Embedding工作原理

大模型开发 - 一文搞懂Embedding工作原理

来源:互联网 更新时间:2026-07-28 15:19

不懂Embedding,何以懂AI?

本文将从三个维度——

Text Embedding工作原理

Image Embedding工作原理

Video Embedding工作原理

——带你一次搞清楚Embedding到底是怎么回事。

大模型开发 - 一文搞懂Embedding工作原理

Embedding可视化

Text Embedding工作原理

文本向量化(Text Embedding)

,简单说就是把文本数据——无论是词、句子还是文档——统统转换成向量的方法。那么,具体怎么做?

词向量化是将每个词映射为二进制或高维实数向量;句子和文档向量化则通过平均、神经网络或主题模型等手段,把整段文本浓缩成一个数值向量。

词向量化

将单个词转换为数值向量,典型方法有两种:

  • 独热编码(One-Hot Encoding)

    :给每个词分配一个唯一的二进制向量,其中只有一个位置是1,其余全是0。
  • 词嵌入(Word Embeddings)

    :像Word2Vec、GloVe、FastText等,把每个词映射到一个高维实数向量,语义相近的词在向量空间中彼此靠近。

词向量化

句子向量化

将整个句子转为一个数值向量,常见做法包括:

  • 简单平均/加权平均

    :对句子中的词向量求平均,或者根据词频加权平均。
  • 递归神经网络(RNN)

    :递归处理每个词,生成句子表示。
  • 卷积神经网络(CNN)

    :用卷积层捕捉局部特征,然后生成句子向量。
  • 自注意力机制(如Transformer)

    :比如BERT模型,通过对句子中每个词进行自注意力计算来获得句子表示。

BERT句子向量化

文档向量化

将整个文档——一篇文章或一组句子——变成数值向量:

  • 简单平均/加权平均

    :对文档中的句子向量平均或加权平均。
  • 文档主题模型(如LDA)

    :通过捕捉文档的主题分布来生成表示。
  • 层次化模型(如Doc2Vec)

    :扩展了Word2Vec,可以生成整个文档的向量。

文档向量化

统计方法方面,TF-IDF和N-gram通过统计生成文本向量;而神经网络方法,如Word2Vec、GloVe等,则通过深度学习来学习文本向量。

基于统计的方法

  • TF-IDF

    :统计词频和逆文档频率来生成词向量或文档向量。
  • N-gram

    :基于n个连续词的频率来生成向量。

TF-IDF

基于神经网络的方法

  • 词嵌入

    • Word2Vec:通过预测词的上下文学习词向量。
    • GloVe:利用全局词共现统计学习词向量。
    • FastText:考虑词的n-gram特征来学习词向量。
  • 句子嵌入

    • RNN(包括LSTM和GRU):处理变长句子,生成句子向量。
    • Transformer:使用自注意力机制和位置编码,生成句子向量。
  • 文档嵌入

    • Doc2Vec:扩展Word2Vec,生成整个文档的向量。
    • BERT:基于Transformer的预训练模型,可生成句子或短文档的向量。

Word2Vec

工作原理

:把离散的文字信息(比如单词)转换成连续的向量数据。这样,语义相似的词在向量空间中位置相近,并且通过高维度来捕捉语言的复杂性。

  • 将离散信息(单词、符号)转换为分布式连续值数据(向量)。
  • 相似的项目(比如语义相近的单词)在向量空间中被映射到相近的位置。
  • 提供了更多的维度(例如1536个维度)来表示人类语言的复杂度。

举例来说,这里有三个句子:

  • “The cat chases the mouse” 猫追逐老鼠。
  • “The kitten hunts rodents” 小猫捕猎老鼠。
  • “I like ham sandwiches” 我喜欢火腿三明治。

人类一眼就能看出句子1和句子2含义差不多,而句子3完全不同。但计算机看到的却是:句子1和句子2只有“The”这个单词相同,其他词汇都不一样。计算机怎么理解前两个句子的相关性?答案就是Embedding。Embedding把每个单词转换成向量,使得语义相近的句子在向量空间中距离很近。所以,即使句子1和句子2没有太多共同词汇,计算机也能判断它们是一回事。

如果是人类来理解,句子1和句子2几乎是同样的含义,而句子3却完全不同。但我们看到句子1和句子2只有“The”是相同的,没有其他相同词汇。计算机该如何理解前两个句子的相关性?

Embedding将单词转换为向量,使得语义相似的句子在向量空间中位置相近。这样,即使句子1和句子2没有很多共同词汇,计算机也能理解它们的相关性。

向量空间可视化

Image Embedding工作原理

图像向量化(Image Embedding)

,就是把图像数据转换成向量的过程。卷积神经网络和自编码器都是有效的工具:前者通过训练提取图像特征并转为向量,后者则学习图像的压缩编码以生成低维向量表示。

  • 卷积神经网络(CNN)

    :通过训练CNN模型,从原始图像提取特征并表示为向量。比如使用预训练模型(VGG16、ResNet)的特定层作为特征提取器。
  • 自编码器(Autoencoders)

    :一种无监督神经网络,学习输入数据的有效编码。在图像向量化中,它学习从图像到低维向量的映射。

CNN

工作原理

:通过算法提取图像的关键特征点及其描述符,将这些特征转换为高维向量表示。这样一来,在向量空间中相似的图像就有相近的向量表示,便于进行图像检索、分类和识别等任务。

  • 特征提取

    :使用SIFT、SURF、HOG等算法从图像中提取关键特征点和描述符。
  • 高维空间

    :图像向量通常在高维空间中表示,每个维度对应一个特征或特征描述符。
  • 相似度度量

    :在向量空间中,可以用欧氏距离、余弦相似度等距离度量来比较不同图像向量的相似度。

图像向量化

Video Embedding工作原理

视频向量化(Video Embedding)

:OpenAI的Sora把视觉数据转换成图像块(Turning visual data into patches)。

  • 视觉块的引入

    :为了将视觉数据转换成适合生成模型处理的格式,研究者提出了视觉块嵌入编码(visual patches)的概念。这些视觉块是图像或视频的小部分,类似于文本中的词元。
  • 处理高维数据

    :在高维视觉数据(如视频)面前,先把它压缩到一个低维潜在空间,减少数据复杂性的同时保留足够的信息供模型学习。

将视觉数据转换为图像块

工作原理

:Sora用visual patches代表被压缩后的视频向量进行训练,每个patches相当于GPT中的一个token。使用patches,可以对视频、音频、文字进行统一的向量化表示,和大模型中的tokens类似,Sora用patches表示视频,把视频压缩到低维空间(latent space)后表示为Spacetime patches。

OpenAI大模型的核心架构:大力出奇迹。

Embedding技术实现了文本、图像、视频等数据的向量化表示,为大型模型提供了丰富的特征输入。只要模型规模足够大,这些向量化数据就能驱动模型生成各种所需的内容,体现了“万物皆可生成”的能力。

关于宇宙的好的网名有哪些
关于宇宙的好的网名有哪些

类型:角色扮演

大小:1

语言:简体中文

平台:互联网

游戏下载

热门手游

手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc