来源:互联网 更新时间:2026-08-12 15:54
今天我们来聊聊 Shopee 在电商知识图谱构建和大模型结合方面的一些探索与思考。
1. 电商知识图谱概览
2. 电商知识图谱构建
3. 电商知识图谱应用
4. 知识图谱与大模型探索
5. 问答环节
分享嘉宾|郑鑫博士 Shopee Senior Expert Engineer
出品社区|DataFun
对于任何电商平台而言,商品都是连接买家和卖家的核心纽带。围绕这三者,有几个问题需要解决:
解决这些问题,方法有很多。深度学习和大模型是当前的热门选手,优势明显,在很多任务上效果出众,泛化能力也强。但它们的短板同样突出:缺乏直观的可解释性,需要大量标注数据,对计算资源要求极高,而且大模型还有著名的“幻觉”问题。
相比之下,知识图谱的优势就很清晰了:它能把异构数据源转化为结构化的知识,处理起来非常方便。知识图谱的核心三要素是实体、关系和属性,通过“实体-关系-实体”的方式来表达数据间的关联。这种清晰的结构带来了更强的可解释性。当然,知识图谱也有自己的难处——构建难度大,泛化能力相对有限,往往需要强大的推理能力或人工介入才能达到企业所需的通用性。
目前来看,知识图谱还远没有被深度学习或大模型完全取代的可能。它带来的价值,对买家、卖家和平台来说都是实打实的。一套统一的商品知识图谱,能显著提升用户体验,比如让买家方便地进行同款商品的横向对比,或在相同维度上比较不同商品,甚至挖掘多维度信息。
对卖家而言,知识图谱可以优化管理逻辑,比如对同一店铺的商品做去重和质量优化。对于同市场内的同款商品,平台还能给出优化建议,帮助提升竞争力。同时,还能及时提醒卖家补足同市场中不同商品的信息。对于跨境电商来说,则能帮助卖家快速发现和输出跨市场的爆品。
至于电商平台本身,知识图谱能有效降低运营成本。通过商品聚合管理,可以大幅减少管理维度,实现跨市场商品对比,还能进行同类或跨类商品的效率分析,为品类扩张和招商活动提供有力支撑。
上图展示的是电商知识图谱的基本形态,可以看到,其中的信息是多维度、多层级,且跨越多个信息源的。比如,卖家的信息会补充商品基础内容之外的细节,像优惠券、付款方式、发货地等。这些因素都在不同程度上影响着最终的购买转化。借助这些图谱,我们能高效地进行连接和关系推理。
接下来,我们正式进入知识图谱构建的核心环节。
在电商领域搭建知识图谱,面临的挑战相当集中:
电商领域构建知识图谱的基本框架,都是从数据源出发,无论是同构还是异构信息。第一步是信息抽取,然后是知识融合,最后是知识加工。这里不展开每个环节的细节,只针对其中的难点分享我们的应对方案。
先来统一一下我们对信息源的叫法。上图是一个典型的商品详情页,里面包含了标题、图片、variation(即具体SKU的选择部分)、结构化的商品详情、自由文本的商品描述,以及买家的评论信息。
在正式抽信息之前,想强调一点:对电商平台来说,一个重要的基石是 Ontology 的定义和结构化。为什么重要?因为商品信息太丰富了,我们并不需要抽取所有内容,很多时候只需要抽取那些对实际应用和业务诉求有直接帮助的信息就够了。构建方法基本分两类:一是靠领域专家知识,二是通过数据主动挖掘。前者确实很费人力,我们最近也在琢磨怎么通过数据挖潜,发现一些未知的本体形式和结构。
以 Shopee 为例,我们的 Ontology 结构主要分两层:
下面具体说说信息抽取中的难点和我们的对策。
以类目信息提取为例,输入信息基本就是商品,包含图片和标题。了解这个信息源后,就能发现质量问题有多棘手。比如第一个商品,从图片上很难辨认卖的是什么,因为背景太乱。但通过其他质量较高的图片,就能看出卖的是鼠标垫。针对这种情况,我们可以在多个信息源里筛选出更高质量的信息再作为模型输入,效果会好很多。
其次,信息还可能模糊或不完整。比如右边的例子,单看图片以为是架子鼓,但标题里写的是儿童乐器玩具,应该归到儿童玩具类目而不是乐器类目,这个偏差可不小。
同时,对跨境电商平台来说,多语言适配也是个大课题。code switch(语言混用)在我们的场景里非常常见。
针对信息质量参差不齐的问题,我们分别对文本和图片信息做了质量评估。文本方面,除了基于规则的简单方法(比如标题太短或太长通常质量不高),我们还训练了多任务模型。输入商品标题后,一方面做文本分类,另一方面抽取标题里的关键词。一个关键假设是:高质量的关键词(通常是品类词)或标题,其对应的类别输出应该是一致。基于这个假设,我们训练了多任务模型,综合各维度评估得到文本质量评分。
图片方面,评估维度包括像素、是否包含多个实体、是否包含文字、背景是否杂乱等。把这些信息整合起来,就能得到图片质量评分。
综合文本和图片质量评分,我们可以从海量信息源中筛选出更高质量的数据,为后续模型的最终预测提供质量保障。
针对信息模糊或不完整的问题,我们采用文本和图片交叉验证的方案。说到交叉验证,大家可能立刻想到多模态模型。我们确实做了大量尝试,微调了 ALBEF 模型,通过图像和文本的对比学习结构直接预测品类。
我们还重点优化了图像和文本的表示学习,融入了多语言商品信息,搭建了 Labse-DinoV2-Vit 等模型。在一些容易混淆的类目上,效果提升非常明显。
多语言适配方面,我们尝试了多种语言模型,比如用 Labse 结构做多语言信息对齐,还对比了编码器-解码器结构(如 Flan-T5)和解码器模型(如 Llama 系列),分别在多语言电商商品信息上微调。由于这些模型结构大,推理时需要更快的速度,我们也尝试用 MiniLM 等方法进行模型压缩。
信息抽取之后,下一步是知识融合,难点在于实体消歧。下面结合类目和属性的具体问题,说说我们的方案。
以类目为例,输入是文本和对应的图片,消歧问题主要体现在文本和图片信息的冲突。比如右边这个例子,商品图片质量很高,但光看图很难判断是在卖上衣、短裤还是整套服装。通过标题,我们能明确推断出是在卖上衣。因此,我们结合文本和图像对齐任务,训练了一些模型,典型的如 Blip,并做了改进。
但文本和图像对齐任务要求语义表达尽可能匹配,这在电商场景里不一定总是成立。比如刚才的例子,图片里只有上衣能和标题对齐;另一方面,标题里也会包含图片没有展示的信息,卖家经常添加一些图片无法表现的属性。所以,这两者并不是完全对称的。
针对这个领域特有的问题,我们调整了模型,比如做了文本引导的图像生成分类,以及图像引导的文本分类。同时加入对齐信息约束,避免出现颜色匹配但商品不匹配的情况,确保图片中的实体对象和文本中的关键商品词对齐匹配。
属性识别任务中,实体消歧也有难点。比如同一个属性可能有多个属性值:颜色属性从标题抽到的是“红色”,但从描述里抽到的却是“黑色”,哪个对?还是两个得结合起来用?另一个例子是,多个属性抽到相同的属性值,比如颜色和材质同时抽到了“gold”,是两者都正确,还是只属于其中一个?还有的属性值可能跨越不同属性,比如标题里抽到颜色是“red”,品牌又抽到“red mi”,这时候“red”既属于颜色属性,又属于品牌属性。
针对这些问题,我们尝试了多种方案。首先搭建了常用的 NER 模型(如 BERT NER)做属性提取。随着大模型的发展,我们也用到生成式模型的能力,主动生成属性值。在 T5 模型基础上,用 prompt tuning 方法训练了模型。结果令人惊喜,在一些容易产生歧义的案例中,准确率显著提升。
知识融合的另一个难题是实体对齐。以属性为例,实体对齐涉及多种类型,目标是让同一属性值的不同表达方式对齐。拼写错误可以通过编辑距离、语义相似度、常见错误集合等方法处理。不同语言的问题,可以用多语言嵌入相似度和模型翻译等方法解决。同义词和近义词的区分比较复杂,我们借鉴了 Labse 模型框架,训练了一个同义词模型,重点区分词形相似但语义差别很大,以及词形不同但语义相近的情况。还有不同单位的问题,比如一个人用“50cm”,另一个人用“0.5m”,我们做了单位转换计算等处理。
对齐这些词后,会发现同一个属性词可能有很多选项。在这么多选项里,需要选一个标准词来代表相同的含义。选择标准词的标准有很多,比如流行度,即哪个词用的人最多。但流行度并不适用于所有场景。举例来说,在印尼市场,错误拼写的使用量最大,但错误拼写在很多情况下并不能准确表达商品的含义。所以我们还考虑了困惑度和标准表达能力,综合这些因素训练了一个模型,选择相应的标准值。
知识加工这一步,重点说说信息推理和不一致检测。这两个任务放在一起讨论,因为它们其实是相互关联的。利用一些信息可以进行推理,同时也可以反向用推理结果来校验提取信息的准确性。如果出现冲突,那很可能其中一个任务出了问题,所以这两个任务可以相互校验。
这里仍然以属性为例。传统方法通常用关联规则挖掘。比如左图的例子,看品牌和型号的关系,如果提取到商品型号是 iPhone 15,那就可以反向推理出品牌一定是苹果(Apple),这是一种单向推理。但如果已知品牌是小米,型号却是 iPhone 15,那显然是错误的。
除了传统方法,我们还结合了知识图谱嵌入推理的方法。比如通过归纳推理,给定一些头实体和它们的描述文本信息,预测它们与其他实体之间是否可能存在某种关系,这样就能做信息补全。
最近我们还发现一些研究在做类比推理,即进行平行关系的推演。类比推理可以基于已有节点之间的关系形态,类比扩展到其他节点之间的相似关系结构。归纳推理和类比推理都可以用于知识图谱补全。归纳推理像是从一个点出发,推理出不同方向的关系或连接的实体,可能存在于图中也可能不存在;类比推理则是进行平行关系的推演。它们适用于不同场景,而在电商领域,信息不完整是常态,所以知识推理和补全就格外重要。
接下来,看看知识图谱在电商领域的一些具体落地案例。
首先是知识图谱与流量侧的结合。在搜索场景中,以 VLP 场景为例,知识图谱可以帮助处理查询,包括识别商品的特定属性和标签,然后将这些信息直接注入相应的索引系统。当出现相关查询并解析出对应的属性和标签时,就能进行高效对齐。这样一来,搜索系统补充召回了大量相关数据,排序过程中的相关性也得到了提升。最终,转化效率自然水涨船高。
推荐场景下也有多种应用。以每日发现场景为例,在基础类别之上,我们提供了更细粒度的品类信息。可以在召回过程中补充细粒度品类召回,同时,向用户展示商品时,对相邻商品的同品类信息进行打散,增加了用户看到信息的丰富度。结果显示,用户的兴趣度明显提升,impression、点击率等指标都有显著改善。
除了流量侧,运营侧的应用案例也不少。比如与商家系统结合,通过对数据的分析,针对类目填写不正确、属性填写不标准等问题,为商家提供优化建议和方案。
另外,与选品系统结合,为商品打上不同类别、属性和标签等标识。运营团队可以根据每个卖场想表达的主题,灵活组合他们想推荐的商品。这样一来,选品筛选变得更高效,选出的商品也更相关。
最后,我们来探讨一下知识图谱与大模型的结合。
目前主要有三种结合方式:第一种是把知识图谱作为大模型的输入;第二种是把大模型作为知识图谱的输入;第三种是双方协同训练。
上图中的结构图来自一篇整理得非常清晰的调查报告,推荐大家参考,这里不多展开。只分享一个有趣的发现在整个知识梳理过程中,我们发现一个比较薄弱的环节——知识图谱的补全。虽然补全机制在理论上容易理解(比如归纳推理和类比推理),但实际应用中的相关工作及成功案例仍然比较少。
在知识图谱构建中,一个关键问题是如何更全面地覆盖知识。如何借助大模型,根据不断更新的自然知识来补充知识图谱,依然是个难题。此外,大模型天然存在的知识幻觉问题,让自动验证补充信息的准确性变得尤为棘手。
让我们聚焦到电商领域,看看知识图谱与大模型怎么结合。前面提到的三种方式在这里都适用。除此之外,电商领域的信息更新速度非常快,每天我们都有数十万甚至上百万个新商品注入和更新。在这种情况下,怎么利用 RAG 等技术帮助大模型和知识图谱实现及时更新,同时快速响应实际应用场景,这是值得研究的重要方向。
在及时更新的过程中,又怎么把实时发现的知识与已有的知识图谱融合、去重,并沉淀下来作为未来的基础使用?这里面有很多细节值得深挖。
推理速度的优化也是老生常谈的话题,尤其在实际应用场景(包括电商平台)里,大模型的推理速度往往是个很大的瓶颈。目前加速的方式已经很多,比如量化、模型压缩等,这里就不展开了。
这里分享一篇有趣的研究。它关注的不是用了什么技术来压缩模型或量化推理,而是从应用层面发现:对不同任务,不一定需要运行大模型的所有层级。一些简单任务可能只需要跑完浅层信息推理就能得出结论,较难的任务再适配更多层模型信息。这为我们提供了一个新思路,在优化时可以结合不同的应用场景做选择性适配。
另外,多模态知识图谱也是一个方向。对电商平台来说,所有信息源天然是多模态的,包括文本、图片和视频。我们可以尝试高效地将这些不同模态的信息源融合到知识图谱中,并整合到更多下游应用里。
从整个电商平台的视角来看,也已经有很多与大模型结合的成功案例。比如最近不少平台都在试水 AI 助手,最初是受到搜索平台结合 AI 助手的启发,通过强大的搜索引擎和建模系统来改变平台和卖家之间的互动方式。当然,这需要经验证以确保符合用户习惯,并根据反馈持续迭代。
除此之外,还能帮助卖家生成 AI 模特图,节省运营成本和时间。甚至可以通过二维图像甚至文字描述,升级到三维视频展示,结合实际商品的应用场景,为卖家创造更直观的展示效果。
近期,多模态大语言模型出现爆发式增长,ChatGPT-4、Gemini、Sora、Claude 3 等都是代表,提供了强大的多模态能力。这些模型的出现引发了热烈讨论:未来是不是能实现一键式商品生成?虽然现在很多声称“一键生成”的功能,实际上都需要卖家进行大量手动输入。但如果这些模型真正落地,或许真的只需要卖家上传一张商品图片,就能自动生成标题、描述、高质量图片甚至视频。这些应用场景潜力巨大。
最后做个总结。首先,通过电商知识图谱概览,我们分析了为什么电商平台需要知识图谱,它能为卖家、买家和平台带来哪些价值。接着,按照知识图谱构建的基本流程,针对其中的难点分享了我们的解决方案。第三部分介绍了实际的应用场景和效果。最后探讨了知识图谱以及电商平台与大模型的结合。展望未来,知识图谱加的大模型还会在更广阔的场景中发挥价值。
腾讯ima怎么把微信内容一键导入知识库?
腾讯ima怎么创建共享知识库?
Celestia价格预测2026-2032:TIA币能否引领山寨币上涨行情?历史价格回顾
新浪互联网热点小时报丨2026年07月26日16时_今日实时互联网热点速递
比特币(BTC)核心周期指标复刻历史走势 价格或跌破5.8万美元关键支撑位
比特币 2025 年价格预测:BTC 的未来走势
新浪机器学习热点小时报丨2026年07月25日18时_今日实时机器学习热点速递
WorkBuddy微信版怎么获得积分?
新浪人工智能热点小时报丨2026年07月30日18时_今日实时人工智能热点速递
男生高性价比充电头?
博世壁挂炉关闭暖气怎么操作
5000元起的鼠标哪个最值得入手?
车载冰箱重置到出厂设置几步?
短剧《史上最强洪荒修为》剧情介绍
管线机怎么接云米净水器
结婚家电首选:Leader懒人三筒Ultra热泵洗烘一体
笔记本移动电源推荐哪款?
腾讯ima知识库怎么分类管理?
海尔消毒柜自动消毒如何中止
kimi提示词专家使用方法新手指南
手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc