热门搜索:和平精英 原神 街篮2 

您的位置:首页 > > 教程攻略 > ai资讯 >电商知识图谱建设及大模型应用探索

电商知识图谱建设及大模型应用探索

来源:互联网 更新时间:2026-08-12 15:54

今天我们来聊聊 Shopee 在电商知识图谱构建和大模型结合方面的一些探索与思考。

主要内容包括以下五大部分:

1. 电商知识图谱概览
2. 电商知识图谱构建
3. 电商知识图谱应用
4. 知识图谱与大模型探索
5. 问答环节

分享嘉宾|郑鑫博士 Shopee Senior Expert Engineer
出品社区|DataFun

01 电商知识图谱概览

对于任何电商平台而言,商品都是连接买家和卖家的核心纽带。围绕这三者,有几个问题需要解决:

  • 首先,买家和卖家的表达习惯完全不同,怎么让买家的购买意图和卖家的商品信息精准匹配,最终促成交易?
  • 其次,卖家之间的表达差异也很大,新手和成熟卖家、本地卖家和跨境卖家,各自有各自的表述方式。平台该如何统一管理这些商品,消除信息差异?
  • 另外,像 Shopee 这样的跨境电商平台,还面临着跨市场和跨语言的挑战。怎样对齐不同市场的商品,实现高效管理?

解决这些问题,方法有很多。深度学习和大模型是当前的热门选手,优势明显,在很多任务上效果出众,泛化能力也强。但它们的短板同样突出:缺乏直观的可解释性,需要大量标注数据,对计算资源要求极高,而且大模型还有著名的“幻觉”问题。

相比之下,知识图谱的优势就很清晰了:它能把异构数据源转化为结构化的知识,处理起来非常方便。知识图谱的核心三要素是实体、关系和属性,通过“实体-关系-实体”的方式来表达数据间的关联。这种清晰的结构带来了更强的可解释性。当然,知识图谱也有自己的难处——构建难度大,泛化能力相对有限,往往需要强大的推理能力或人工介入才能达到企业所需的通用性。

目前来看,知识图谱还远没有被深度学习或大模型完全取代的可能。它带来的价值,对买家、卖家和平台来说都是实打实的。一套统一的商品知识图谱,能显著提升用户体验,比如让买家方便地进行同款商品的横向对比,或在相同维度上比较不同商品,甚至挖掘多维度信息。

对卖家而言,知识图谱可以优化管理逻辑,比如对同一店铺的商品做去重和质量优化。对于同市场内的同款商品,平台还能给出优化建议,帮助提升竞争力。同时,还能及时提醒卖家补足同市场中不同商品的信息。对于跨境电商来说,则能帮助卖家快速发现和输出跨市场的爆品。

至于电商平台本身,知识图谱能有效降低运营成本。通过商品聚合管理,可以大幅减少管理维度,实现跨市场商品对比,还能进行同类或跨类商品的效率分析,为品类扩张和招商活动提供有力支撑。

上图展示的是电商知识图谱的基本形态,可以看到,其中的信息是多维度、多层级,且跨越多个信息源的。比如,卖家的信息会补充商品基础内容之外的细节,像优惠券、付款方式、发货地等。这些因素都在不同程度上影响着最终的购买转化。借助这些图谱,我们能高效地进行连接和关系推理。

接下来,我们正式进入知识图谱构建的核心环节。

02 电商知识图谱构建

1. 电商知识图谱构建难点

在电商领域搭建知识图谱,面临的挑战相当集中:

  • 首先是信息多元。信息来自四面八方,包括买家和卖家。有时候商品本身的信息不完整,但我们可以从买家评论里反向提取出有效的补充信息。另外,表达方式也五花八门。比如“ready stock”这个词在东南亚市场是高频词汇,但在拉美市场可能就没人认。
  • 第二是质量参差不齐。举个典型的例子,卖家在标题里把品牌写成“Sumsung”,这种拼写错误、信息错误、冗余或缺失,在电商平台上比比皆是。
  • 第三是依赖领域知识。某些品类的商品,需要专业领域的知识才能准确判断。比如摩托车里的“50CC”,不熟悉的人根本搞不清是指型号还是排量,这时候就得靠领域信息来验证。
  • 最后是数据量庞大。以 Shopee 为例,我们有数十亿种商品,覆盖 8 个市场、6 种语言。如何把这么庞大的信息融合成一个统一的知识图谱,本身就是个巨大挑战。

2. 电商知识图谱基本框架

电商领域构建知识图谱的基本框架,都是从数据源出发,无论是同构还是异构信息。第一步是信息抽取,然后是知识融合,最后是知识加工。这里不展开每个环节的细节,只针对其中的难点分享我们的应对方案。

3. 电商知识图谱构建方法

(1)数据源

先来统一一下我们对信息源的叫法。上图是一个典型的商品详情页,里面包含了标题、图片、variation(即具体SKU的选择部分)、结构化的商品详情、自由文本的商品描述,以及买家的评论信息。

(2)信息抽取

在正式抽信息之前,想强调一点:对电商平台来说,一个重要的基石是 Ontology 的定义和结构化。为什么重要?因为商品信息太丰富了,我们并不需要抽取所有内容,很多时候只需要抽取那些对实际应用和业务诉求有直接帮助的信息就够了。构建方法基本分两类:一是靠领域专家知识,二是通过数据主动挖掘。前者确实很费人力,我们最近也在琢磨怎么通过数据挖潜,发现一些未知的本体形式和结构。

以 Shopee 为例,我们的 Ontology 结构主要分两层:

  • 第一层是基础定义层,包括类别和属性这类基础元素。类别又分 L1 到 L5 多个层级,属性也包括关键属性和销售属性,都与实际业务场景紧密挂钩。
  • 在基础定义层之上,我们可以把这些基础元素排列组合,形成组合定义层,比如场景、标签、标品等。像“春日露营”这种场景,通常会跨多个类目组合。“户外防水装备”这个标签,意味着户外运动类商品得具备防水属性才行。对标品的定义则更严格,必须完全符合某些类目或属性的定义,才能算作同一个标品。

下面具体说说信息抽取中的难点和我们的对策。

以类目信息提取为例,输入信息基本就是商品,包含图片和标题。了解这个信息源后,就能发现质量问题有多棘手。比如第一个商品,从图片上很难辨认卖的是什么,因为背景太乱。但通过其他质量较高的图片,就能看出卖的是鼠标垫。针对这种情况,我们可以在多个信息源里筛选出更高质量的信息再作为模型输入,效果会好很多。

其次,信息还可能模糊或不完整。比如右边的例子,单看图片以为是架子鼓,但标题里写的是儿童乐器玩具,应该归到儿童玩具类目而不是乐器类目,这个偏差可不小。

同时,对跨境电商平台来说,多语言适配也是个大课题。code switch(语言混用)在我们的场景里非常常见。

针对信息质量参差不齐的问题,我们分别对文本和图片信息做了质量评估。文本方面,除了基于规则的简单方法(比如标题太短或太长通常质量不高),我们还训练了多任务模型。输入商品标题后,一方面做文本分类,另一方面抽取标题里的关键词。一个关键假设是:高质量的关键词(通常是品类词)或标题,其对应的类别输出应该是一致。基于这个假设,我们训练了多任务模型,综合各维度评估得到文本质量评分。

图片方面,评估维度包括像素、是否包含多个实体、是否包含文字、背景是否杂乱等。把这些信息整合起来,就能得到图片质量评分。

综合文本和图片质量评分,我们可以从海量信息源中筛选出更高质量的数据,为后续模型的最终预测提供质量保障。

针对信息模糊或不完整的问题,我们采用文本和图片交叉验证的方案。说到交叉验证,大家可能立刻想到多模态模型。我们确实做了大量尝试,微调了 ALBEF 模型,通过图像和文本的对比学习结构直接预测品类。

我们还重点优化了图像和文本的表示学习,融入了多语言商品信息,搭建了 Labse-DinoV2-Vit 等模型。在一些容易混淆的类目上,效果提升非常明显。

多语言适配方面,我们尝试了多种语言模型,比如用 Labse 结构做多语言信息对齐,还对比了编码器-解码器结构(如 Flan-T5)和解码器模型(如 Llama 系列),分别在多语言电商商品信息上微调。由于这些模型结构大,推理时需要更快的速度,我们也尝试用 MiniLM 等方法进行模型压缩。

(3)知识融合

信息抽取之后,下一步是知识融合,难点在于实体消歧。下面结合类目和属性的具体问题,说说我们的方案。

以类目为例,输入是文本和对应的图片,消歧问题主要体现在文本和图片信息的冲突。比如右边这个例子,商品图片质量很高,但光看图很难判断是在卖上衣、短裤还是整套服装。通过标题,我们能明确推断出是在卖上衣。因此,我们结合文本和图像对齐任务,训练了一些模型,典型的如 Blip,并做了改进。

但文本和图像对齐任务要求语义表达尽可能匹配,这在电商场景里不一定总是成立。比如刚才的例子,图片里只有上衣能和标题对齐;另一方面,标题里也会包含图片没有展示的信息,卖家经常添加一些图片无法表现的属性。所以,这两者并不是完全对称的。

针对这个领域特有的问题,我们调整了模型,比如做了文本引导的图像生成分类,以及图像引导的文本分类。同时加入对齐信息约束,避免出现颜色匹配但商品不匹配的情况,确保图片中的实体对象和文本中的关键商品词对齐匹配。

属性识别任务中,实体消歧也有难点。比如同一个属性可能有多个属性值:颜色属性从标题抽到的是“红色”,但从描述里抽到的却是“黑色”,哪个对?还是两个得结合起来用?另一个例子是,多个属性抽到相同的属性值,比如颜色和材质同时抽到了“gold”,是两者都正确,还是只属于其中一个?还有的属性值可能跨越不同属性,比如标题里抽到颜色是“red”,品牌又抽到“red mi”,这时候“red”既属于颜色属性,又属于品牌属性。

针对这些问题,我们尝试了多种方案。首先搭建了常用的 NER 模型(如 BERT NER)做属性提取。随着大模型的发展,我们也用到生成式模型的能力,主动生成属性值。在 T5 模型基础上,用 prompt tuning 方法训练了模型。结果令人惊喜,在一些容易产生歧义的案例中,准确率显著提升。

知识融合的另一个难题是实体对齐。以属性为例,实体对齐涉及多种类型,目标是让同一属性值的不同表达方式对齐。拼写错误可以通过编辑距离、语义相似度、常见错误集合等方法处理。不同语言的问题,可以用多语言嵌入相似度和模型翻译等方法解决。同义词和近义词的区分比较复杂,我们借鉴了 Labse 模型框架,训练了一个同义词模型,重点区分词形相似但语义差别很大,以及词形不同但语义相近的情况。还有不同单位的问题,比如一个人用“50cm”,另一个人用“0.5m”,我们做了单位转换计算等处理。

对齐这些词后,会发现同一个属性词可能有很多选项。在这么多选项里,需要选一个标准词来代表相同的含义。选择标准词的标准有很多,比如流行度,即哪个词用的人最多。但流行度并不适用于所有场景。举例来说,在印尼市场,错误拼写的使用量最大,但错误拼写在很多情况下并不能准确表达商品的含义。所以我们还考虑了困惑度和标准表达能力,综合这些因素训练了一个模型,选择相应的标准值。

(4)知识加工

知识加工这一步,重点说说信息推理和不一致检测。这两个任务放在一起讨论,因为它们其实是相互关联的。利用一些信息可以进行推理,同时也可以反向用推理结果来校验提取信息的准确性。如果出现冲突,那很可能其中一个任务出了问题,所以这两个任务可以相互校验。

这里仍然以属性为例。传统方法通常用关联规则挖掘。比如左图的例子,看品牌和型号的关系,如果提取到商品型号是 iPhone 15,那就可以反向推理出品牌一定是苹果(Apple),这是一种单向推理。但如果已知品牌是小米,型号却是 iPhone 15,那显然是错误的。

除了传统方法,我们还结合了知识图谱嵌入推理的方法。比如通过归纳推理,给定一些头实体和它们的描述文本信息,预测它们与其他实体之间是否可能存在某种关系,这样就能做信息补全。

最近我们还发现一些研究在做类比推理,即进行平行关系的推演。类比推理可以基于已有节点之间的关系形态,类比扩展到其他节点之间的相似关系结构。归纳推理和类比推理都可以用于知识图谱补全。归纳推理像是从一个点出发,推理出不同方向的关系或连接的实体,可能存在于图中也可能不存在;类比推理则是进行平行关系的推演。它们适用于不同场景,而在电商领域,信息不完整是常态,所以知识推理和补全就格外重要。

03 电商知识图谱应用

接下来,看看知识图谱在电商领域的一些具体落地案例。

首先是知识图谱与流量侧的结合。在搜索场景中,以 VLP 场景为例,知识图谱可以帮助处理查询,包括识别商品的特定属性和标签,然后将这些信息直接注入相应的索引系统。当出现相关查询并解析出对应的属性和标签时,就能进行高效对齐。这样一来,搜索系统补充召回了大量相关数据,排序过程中的相关性也得到了提升。最终,转化效率自然水涨船高。

推荐场景下也有多种应用。以每日发现场景为例,在基础类别之上,我们提供了更细粒度的品类信息。可以在召回过程中补充细粒度品类召回,同时,向用户展示商品时,对相邻商品的同品类信息进行打散,增加了用户看到信息的丰富度。结果显示,用户的兴趣度明显提升,impression、点击率等指标都有显著改善。

除了流量侧,运营侧的应用案例也不少。比如与商家系统结合,通过对数据的分析,针对类目填写不正确、属性填写不标准等问题,为商家提供优化建议和方案。

另外,与选品系统结合,为商品打上不同类别、属性和标签等标识。运营团队可以根据每个卖场想表达的主题,灵活组合他们想推荐的商品。这样一来,选品筛选变得更高效,选出的商品也更相关。

04 知识图谱与大模型探索

最后,我们来探讨一下知识图谱与大模型的结合。

目前主要有三种结合方式:第一种是把知识图谱作为大模型的输入;第二种是把大模型作为知识图谱的输入;第三种是双方协同训练。

上图中的结构图来自一篇整理得非常清晰的调查报告,推荐大家参考,这里不多展开。只分享一个有趣的发现在整个知识梳理过程中,我们发现一个比较薄弱的环节——知识图谱的补全。虽然补全机制在理论上容易理解(比如归纳推理和类比推理),但实际应用中的相关工作及成功案例仍然比较少。

在知识图谱构建中,一个关键问题是如何更全面地覆盖知识。如何借助大模型,根据不断更新的自然知识来补充知识图谱,依然是个难题。此外,大模型天然存在的知识幻觉问题,让自动验证补充信息的准确性变得尤为棘手。

让我们聚焦到电商领域,看看知识图谱与大模型怎么结合。前面提到的三种方式在这里都适用。除此之外,电商领域的信息更新速度非常快,每天我们都有数十万甚至上百万个新商品注入和更新。在这种情况下,怎么利用 RAG 等技术帮助大模型和知识图谱实现及时更新,同时快速响应实际应用场景,这是值得研究的重要方向。

在及时更新的过程中,又怎么把实时发现的知识与已有的知识图谱融合、去重,并沉淀下来作为未来的基础使用?这里面有很多细节值得深挖。

推理速度的优化也是老生常谈的话题,尤其在实际应用场景(包括电商平台)里,大模型的推理速度往往是个很大的瓶颈。目前加速的方式已经很多,比如量化、模型压缩等,这里就不展开了。

这里分享一篇有趣的研究。它关注的不是用了什么技术来压缩模型或量化推理,而是从应用层面发现:对不同任务,不一定需要运行大模型的所有层级。一些简单任务可能只需要跑完浅层信息推理就能得出结论,较难的任务再适配更多层模型信息。这为我们提供了一个新思路,在优化时可以结合不同的应用场景做选择性适配。

另外,多模态知识图谱也是一个方向。对电商平台来说,所有信息源天然是多模态的,包括文本、图片和视频。我们可以尝试高效地将这些不同模态的信息源融合到知识图谱中,并整合到更多下游应用里。

从整个电商平台的视角来看,也已经有很多与大模型结合的成功案例。比如最近不少平台都在试水 AI 助手,最初是受到搜索平台结合 AI 助手的启发,通过强大的搜索引擎和建模系统来改变平台和卖家之间的互动方式。当然,这需要经验证以确保符合用户习惯,并根据反馈持续迭代。

除此之外,还能帮助卖家生成 AI 模特图,节省运营成本和时间。甚至可以通过二维图像甚至文字描述,升级到三维视频展示,结合实际商品的应用场景,为卖家创造更直观的展示效果。

近期,多模态大语言模型出现爆发式增长,ChatGPT-4、Gemini、Sora、Claude 3 等都是代表,提供了强大的多模态能力。这些模型的出现引发了热烈讨论:未来是不是能实现一键式商品生成?虽然现在很多声称“一键生成”的功能,实际上都需要卖家进行大量手动输入。但如果这些模型真正落地,或许真的只需要卖家上传一张商品图片,就能自动生成标题、描述、高质量图片甚至视频。这些应用场景潜力巨大。

最后做个总结。首先,通过电商知识图谱概览,我们分析了为什么电商平台需要知识图谱,它能为卖家、买家和平台带来哪些价值。接着,按照知识图谱构建的基本流程,针对其中的难点分享了我们的解决方案。第三部分介绍了实际的应用场景和效果。最后探讨了知识图谱以及电商平台与大模型的结合。展望未来,知识图谱加的大模型还会在更广阔的场景中发挥价值。

05 问答环节

Q1:质量分的判断是用垂直模型吗?是不是能够用语言模型呢?


A1:质量分部分可以使用语言模型进行判断。但最重要的是要先明确定义质量分要识别的是什么内容。在具体任务定义清晰的前提下,语言模型是一种可行的方案。

Q2:实体语义消歧或实体合并有哪些好的方法或建议?比如两个不同的地址如何识别为同一个地址?


A2:实体消歧涉及地址这类信息时,建议先获取领域知识,并结合辅助信息来判断,比如物流路径是否一致、收件人是否集中等。还可以通过上下文信息辅助判断,但准确性可能有限。

Q3:当训练数据很少时,大模型在知识抽取上如何更好地应用?


A3:在训练数据有限的情况下,可以借助大模型的 prompt 功能,结合 COT 等技术,利用少量输入信息进行推理和泛化。

Q4:知识图谱给大模型白名单,大模型给知识图谱构建,有推荐的工具或算法吗?


A4:目前还没有统一的工具或算法。研究领域涉及多种算法和应用方式,建议深入学习相关文献以获取更多信息。

Q5:知识图谱和电商品分类、商品库有重复性,可以直接用商品库关联大模型吗?


A5:直接使用商品库关联大模型可能会出问题,因为商品库数量庞大,大模型输入信息量也大。需要根据具体场景判断是否需要全部信息关联,可能只需少量输入就能实现目的。

关于宇宙的好的网名有哪些
关于宇宙的好的网名有哪些

类型:角色扮演

大小:1

语言:简体中文

平台:互联网

游戏下载

相关攻略

手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc