来源:互联网 更新时间:2026-08-21 14:30
知识图谱这东西,在网络对齐、问答系统,还有推荐系统这些领域,那都是必不可少的存在。它提供的结构化关系数据,能帮我们推导出很多间接的关联关系。但问题在于,基于知识图谱的推荐系统一旦遇到用户的自然语言输入,麻烦就来了。一方面,自然语言处理单元得有本事应付人类语言里的模糊和变数,才能准确读出用户到底想要什么;另一方面,系统还得精准识别出各种实体——比如产品名称——并且把它们链接到知识图谱里对应的节点上。为了解决这些难题,在联想的支持下,我们搞了一个叫“普罗米修斯”的新型聊天机器人。这个家伙把知识图谱(KG)和大型语言模型(LLM)捏在了一起,专门用来推荐计算机组件。它能准确解码用户的需求,给出基于知识图谱的个性化推荐,保证对用户那些计算机配置需求理解得又准又到位。
关键词:知识图谱;大型语言模型;推荐系统;自然语言处理;计算机组件
知识图谱是一种图结构,里面装着各种事实,节点代表现实世界的实体、事件、对象,边则代表两个节点之间的关系。从2012年第一次亮相到现在,已经冒出了不少知识图谱,比如Freebase、Yago、Wikidata这些。它们的用处也真是五花八门,从网络对齐、问答系统,一直延伸到推荐系统。在这些应用里,基于知识图谱的推荐系统,核心任务就是处理用户输入,然后给出相关推荐。
话说回来,任何推荐系统的灵魂,都在于它的个性化推荐算法。传统算法其实也干得不错,常见的有基于内容的过滤、协同过滤、还有混合过滤。但它们也不是没有毛病,比如用户和项目之间的关系太稀疏了,碰上新用户时又总有冷启动问题。更别提,要把这些算法扩展到能应付现实推荐场景的需求,那本身就是个大挑战。为了突破这些限制,研究人员开始往推荐系统里塞辅助信息——像是用户和项目的属性特征、用户的社交网络、多媒体信息(文本、图像之类)。这里头,知识图谱特别引人注目,因为它能提供丰富的项目背景信息,揭露它们之间那些隐藏的关系,这就让推荐质量一下子提升了不少。
最近几年,基于知识图谱的推荐系统在学术界和工业界都火了起来,在不同领域里开花结果。比如教育领域,推荐系统现在是个关键研究方向,特别关注怎么帮学习者找到合适的学习资源和学术内容。旅游行业也是一样,这些推荐系统能提供量身定制的信息,让用户体验更棒。医疗、娱乐、商业这些领域,知识图谱的应用也越来越多。
一般来说,基于知识图谱的推荐系统由三部分组成:知识图谱、推荐模块、连接模块。知识图谱存着实体的丰富语义信息,推荐模块则负责计算用户和项目之间的关系。连接模块把语义信息映射到低维向量里,再跟推荐模块结合,一起算用户和项目之间的交互信息。不过,跟传统的连接模型不太一样的是,我们这里用了大型语言模型来处理用户输入。
在这篇论文里,在联想的支持下,我们探索着搞出了一个独特的基于知识图谱的推荐系统——“普罗米修斯”聊天机器人,专门用来推荐计算机组件。这个项目的主要目标,就是让用户跟文档的交互变得更简单,能用自然语言提取出有价值的信息。普罗米修斯聊天机器人是用LangChain和GPT-4/ChatGPT搭起来的,能给用户提供流畅自然的对话体验,背后有Azure OpenAI服务和OpenAI的支持。我们的关键贡献有以下几点:
我们用联想的专有数据库,搭建了计算机组件的知识图谱,里面包括了产品名称和相关的规则。
我们把知识图谱和大型语言模型结合起来,做出了普罗米修斯聊天机器人,给行业立了个新标杆,尤其是在处理复杂的计算机组件这块。
普罗米修斯聊天机器人把知识图谱构建、自然语言处理和聊天机器人设计整合到了一起,形成了一个完整的计算机组件推荐系统。整个系统建立在三大支柱上:Neo4j数据库用来构建知识图谱,Azure OpenAI服务用来处理自然语言,Streamlit用来搭建聊天机器人的界面。
构建知识图谱是个反复迭代的工程活儿,涉及各种方法和工具。这些方法可以分两大类:自上而下和自下而上。
自上而下的方法,根子在于数据库构建里的建模过程。它先从识别主题领域和研究需求开始,然后设计一个概念模型,把感兴趣的实体、关系、类别都收集起来。像CmapTools这类工具,在概念建模这块特别好使。接着,再创建逻辑模型和物理模型,给收集来的实体和关系加上逻辑表示和断言。到了技术开发和实施阶段,就得考虑编码语言(比如RDF和OWL)、序列化格式(比如RDF/XML、Turtle、JSON-LD),还有KG开发平台,比如Protégé和DOGMA。最后一步,是把知识图谱部署成服务,让社区能复用和反馈,把领域知识变成机器可读的东西。
相比之下,自下而上的方法靠的是众包数据,比如社交媒体和传统文献。社交媒体的爆发和已发表文献的开放获取,让数据源一下子丰富起来,最近这些年用这种方法的出版物也越来越多。自下而上靠处理大量数据集,能快速搭出大型知识图谱,但在实体和关系的精确逻辑表示和断言上,还是有不少挑战。
我们这次的做法,是把自上而下和自下而上结合起来。先采用自上而下的策略,从SQLite数据库(T3.db)里识别出特定类型的规则(文本规则、推导、选择),设计一个包含感兴趣实体和它们关系在内的概念模型。这涉及到逻辑和物理建模,提取出来的规则经过标准化和处理,在Neo4j里创建节点和关系,保证数据的结构化和精确表示。与此同时,我们通过SQL查询提取原始数据,经过预处理去掉不必要的元素,统一格式,这又是自下而上的路子。这种双重方法结合了自上而下的结构化设计,也融入了自下而上特有的数据驱动提取和转换过程。
构建知识图谱,被认为是增强推荐系统的一个很有前途的方向。我们这次用的是图数据库Neo4j。Neo4j一个特别明显的优势,就是简化了识别数据点之间连接的方式。像Python和py2neo这类编程语言,查询时得处理连接,但Neo4j直接把连接存在数据库里,性能一下子高了不少。我们用的是Neo4j的免费版,这样可以无限制地复制结果。
Streamlit应用作为用户友好的前端,跟计算机组件知识图谱交互。这个接口用Azure OpenAI服务来理解和处理自然语言查询,让系统变得特别直观,哪怕技术知识有限的用户也玩得转。
大型语言模型在自然语言处理上展现出了让人印象深刻的实力,这些模型都是基于Transformer架构搭起来的。它们结合了大规模架构和海量的文本训练数据。这种扩展让LLM能理解甚至生成跟人类水平相当的文本。其中,ChatGPT在2022年底成了互联网上的热门话题,稳稳地坐上了“文化现象”的宝座。我们这里用微软Azure OpenAI服务调用ChatGPT API,把用户的自然语言转成Cypher查询。比如,用户可以输入像“请推荐我关于GFX 3050的电源”或“如果我买英特尔i7 CPU,推荐哪些组件?”这样的问题。LLM负责解释这些查询,然后参考我们构建的知识图谱,生成合适的回答。这样一来,系统就能处理各种格式和复杂度的查询,给用户精确的推荐。
搜索过程从用户输入查询开始,比如“告诉我关于M70t Gen5的GFX3050 T3规则”。然后,LLM从查询里提取出相关关键词,这里识别出的是“GFX3050”。这些关键词被注入到知识图谱里。查询会去找那些`name`属性包含“GFX3050”,并且`project name`属性包含“M70t Gen5”的节点,然后返回匹配节点的`T3 rules`属性。最后,系统从知识图谱里把这些信息捡出来,给用户答案。
总的来说,我们开发了一个新工具,在计算机组件推荐上准确度更高了。这个系统简化了找兼容组件的过程,并且用LLM给出上下文感知、个性化的推荐。
这一步涉及到查询一个叫T3.db的SQLite数据库——这是联想的专有数据库,目的是检索计算机组件的规则。我们主要关注三种类型的规则:文本规则、派生规则、选择规则。SQL查询专门用来获取这些规则和它们相关的元数据,确保按照相关性、规则类型和内容来筛选。这一步对于收集原始数据来填充知识图谱至关重要。
提取出来的规则接下来需要处理,去掉不必要的部分,把格式统一起来。处理步骤包括:从原始规则里剔除意外的单词和字符(比如‘||’和‘&&’),给所有规则应用统一的格式,以及把复杂的规则拆成更简单的部分——对于那种结合了多个简单标准的复杂规则,比如“( Intel i5-12400 2.5GHz/6C/12T/18M 65W DDR5 Intel i5-12400F 2.5GHz/6C/12T/18M 65W DDR5 4800|| ✔ Intel i5-12500 3.0GHz/6C/12T/18M 65W DDR5 4800)”,这一步就特别有必要。
清洗过的数据被用来通过Neo4j构建知识图谱。节点和关系被创建,分别代表组件和它们相关的规则。每个节点由名称、原始规则、规则索引、类型、项目名称、日期和所有者组成。节点之间的关系则根据规则来定义,指示兼容性(应该/不应该)。Neo4j数据库被填满了节点和关系。以“推导”类型为例,我们创建了32,776个节点和24,971个关系。
在知识图谱里,每个计算机组件都被表示成一个节点。节点之间的关系通过边来体现,表示“应该”或“不应该”。
举个例子,一个内存单元“64GB( ) DDR4 3200 UDIMM”节点,和它的父节点“32GB DDR4 3200 UDIMM”之间存在着关系,这说明它是基础配置的扩展——在保持内存类型、速度和形状因素兼容性的同时,增加了内存容量。这种结构让系统能进行检查,并建议针对特定使用场景优化的组件配对。
搜索结果和其他相关数据会以清晰、有组织的表格形式呈现出来,让用户能快速理解和比较不同的组件。

我们的工作表明,把知识图谱和大型语言模型结合起来,确实能提高推荐系统的效率。通过把数据库、基于图形的可视化,以及自然语言处理揉到一起,我们的方法处理了推荐计算机组件时那些复杂的环节。结果显示,系统在提供精确和上下文相关建议的能力上有所改善。知识图谱让数据有了结构化的、互联的表示方式,支持更精细的推理和推断。同时,LLM允许用户以自然语言形式提出查询,而且解释的准确性很高。这种结合,算是基于知识图谱的推荐系统向前迈了一步。我们把这个推荐系统叫做“普罗米修斯”,主要是为联想内部使用设计的聊天机器人。
当然,挑战也有。搭建一个广泛的知识图谱,需要花大量的精力来更新和保证原始数据的准确。未来,我们打算扩大知识图谱的覆盖范围,纳入更多的组件和更复杂的规则。这个扩展会让普罗米修斯聊天机器人的能力更上一层楼。另外,把我们的方法用到其他领域,也提供了很有前景的研究机会。那些库存复杂的行业,比如汽车、电子、医疗保健,也可能从我们的方法里受益。知识图谱和大型语言模型更广泛的结合,正预示着未来基于AI的推荐系统的多种可能性。
总而言之,我们的工作展示了知识图谱协作大语言模型在改善推荐系统中的优势。Proetheus在工业界已被证明对更好的计算机组件推荐非常有用。
腾讯ima怎么把微信内容一键导入知识库?
黄金价格不断创新高!黄金稳定币XAU、PAXG市值达11亿美元
腾讯ima怎么创建共享知识库?
CC币价格预测(2026-2035):Canton币今日价格走势+长期价格预测
新浪互联网热点小时报丨2026年07月26日16时_今日实时互联网热点速递
Celestia价格预测2026-2032:TIA币能否引领山寨币上涨行情?历史价格回顾
新浪机器学习热点小时报丨2026年07月25日18时_今日实时机器学习热点速递
比特币(BTC)核心周期指标复刻历史走势 价格或跌破5.8万美元关键支撑位
新浪人工智能热点小时报丨2026年07月30日18时_今日实时人工智能热点速递
WorkBuddy微信版怎么获得积分?
5000元起的鼠标哪个最值得入手?
蚂蚁庄园今日答案7月21日(今日已更新) 蚂蚁庄园今天正确答案是什么呢
车载冰箱重置到出厂设置几步?
短剧《史上最强洪荒修为》剧情介绍
kimi提示词专家使用方法新手指南
结婚家电首选:Leader懒人三筒Ultra热泵洗烘一体
腾讯ima知识库怎么分类管理?
短剧《仙人跳获透视,古玩玉器我全拿捏》剧情介绍
Windy卫星云图怎么看?云层变化识别技巧
一加手机如何设置三指长按屏幕局部截图
手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc