热门搜索:和平精英 原神 街篮2 

您的位置:首页 > > 教程攻略 > ai资讯 >Docs2KG:使用大模型自动构建知识图谱,降低企业知识图谱构建门槛

Docs2KG:使用大模型自动构建知识图谱,降低企业知识图谱构建门槛

来源:互联网 更新时间:2026-08-18 14:17

先说个大背景:对于现代企业来说,信息资源早就不是“辅助工具”了,它已经变成了核心资产。但问题也随之而来——怎么管好这些资源?传统的知识图谱构建方法,不仅耗时耗力,还得投入大量人力去整理数据、定义实体和关系,最后还要靠好几个不同的模型来提取信息,流程又长又贵。

Docs2KG 正是瞄准了这个痛点。它利用大型AI模型的智能处理能力,为企业提供了一条高效又成本可控的新路径,自动把知识图谱建起来。这不仅是流程上的简化,更是把整个运营成本往下压了一截。

摘要

企业数据里,大约80%都是以非结构化的形式躺在数据湖里的,而且格式五花八门。面对这种异构性,传统的搜索引擎已经有点力不从心了。知识图谱正好能派上大用场——它能把异构数据整合起来,把知识表达清楚。

Docs2KG 就是专门干这个的。它能从各种非结构化文档中抽取信息,然后创建出一个统一的知识图谱,让数据湖里的文档能被高效地查询和分析。相比现有技术,Docs2KG 的优势在于它的灵活性和可扩展性——不管文档是什么结构、什么内容,它都能适应。此外,这个框架还支持多种数据后处理任务,让知识在特定领域内更容易被理解。

简介

企业的知识资产,绝大部分都藏在非结构化文档里。这些文档至少占了数据湖的80%。把这些数据整合起来,提取出有价值的信息,同时还要保留原始出处——这能降低信息出错的风险,所以非常关键。

举个医疗领域的例子:患者的记录可能包括手写的临床笔记、出院信、医生之间的电子邮件交流,还有医学图像。要处理好这些数据,得迈过三道坎:一是从多种格式中提取多模态数据;二是把不同模态的信息提取模型集成到统一的框架里;三是用一种有意义的方式把数据的语义表达出来,并且能引用它的来源。

所以,研究者提出了用知识图谱作为统一的信息表示方式,动态地整合从各个模态中提取的实体信息——包括布局实体,这样就能保持对原始数据的引用。Docs2KG 系统能处理的格式很全:电子邮件、网页、PDF文件、Excel文件,都没问题。它生成的知识图谱支持动态自动更新,基于文档结构和内容,而且还能扩展,允许人机交互。它把深度学习、计算机视觉和结构化文档解析结合到一起,实现了文档处理的统一化。最后生成的知识图谱,可以应用到很多实际场景里,比如降低知识过时的风险、增强基于知识的检索能力。

相关工作

大多数构建知识图谱的方法,主要聚焦在从文本资料里抽取信息。比如 Connected Papers 这种工具,能帮研究人员发现和探索相关的学术论文。但 Docs2KG 的路数不一样——它专门处理多样化的非结构化文档。它的架构是动态的,能根据文档的结构自动调整。而且,它高度可定制、可扩展,不管是什么样的非结构化数据,都能适配。

DOCS2KG

Docs2KG 是专为处理各种异构和非结构化文档设计的,支持的类型包括电子邮件、网页、PDF 和 Excel 文件。它的工作流程分成两个关键阶段:先是双路径数据处理,然后是构建多模态统一知识图谱。处理完的数据,不光保留了原始的结构和语义关系,还会被存到 Neo4j 图数据库里——这样一来,查询效率更高,还能直观地可视化。相关的代码和文档也都可以在线访问。

双路径数据处理

这里介绍的是一种创新的双路径文档处理策略,目标是高效处理多种类型的文档。两条路径分别是:

  • 图像转换路径

    :用深度学习技术做文档布局分析,把文档内容转成图像格式。
  • Markdown转换路径

    :把文档内容转成Markdown格式,然后用XPath这类查询语言来处理。

不管是PDF、网页、Excel还是电子邮件,这些文档都能先转成图像,再用文档布局分析技术分割开,提取出文本、图像、表格这些元素。此外,针对不同类型的Markdown文档,还设计了四种独立的解析器,各有各的优化处理方式。

Doc2KG 解析各种格式文档、并把它转化成统一知识图谱的具体方法如下:

  • PDF文件解析

    :看文件的元信息,决定用Markdown转换器还是图像转换器。如果是扫描的PDF文件,就需要用训练好的文档布局分析模型。
  • 网页解析

    :用Python的BeautifulSoup库解析HTML内容,提取文本和图像信息,同时保留原始文档的树状结构,作为布局知识图的一部分。
  • Excel文件解析

    :用Python的pandas库提取数据,然后转成图像格式,再通过图像转换器处理。
  • 邮件解析

    :用Python的email库把邮件内容拆成纯文本、HTML和附件。文本和HTML部分,参考网页的处理方法;附件部分,根据格式选合适的工具。

Doc2KG 的设计走的是模块化路线,用户可以根据需要灵活地配置和组合不同的处理模块,这样计算资源用得更合理,整体效率也更高。

多模态统一知识图谱构建

数据预处理完以后,Docs2KG 会把解析得到的信息整合成一个统一的多模态知识图谱。这个图谱里既有结构化信息(比如层次和空间关系),也有语义信息。图谱中的联系主要分成两大类:模态内部关系和跨模态关系。

模态内部关系构建

:这部分涵盖了不同层级的结构联系,比如标题和段落之间的层级关系,还有句子层面上的语义联系。具体来说:

  • 结构关系:`has-child`、`before`、`after`。
  • 语义关系:`same time`、`focus`、`supported by`、`explain`。

模态间关系构建

:在跨模态关系这部分,Docs2KG 用的是语义联系来描述不同模态之间的相互关系。因为模态内部的层次和空间联系已经明确界定了关系的方向,所以跨模态关系可以这样处理:最小单位子图表示句子(比如表格标题),而表和图则通过语义关系(如“explain”和“same-time”)连接起来。

示例

这里用一个具体的例子来展示:通过图查询和RAG应用来做数据驱动分析。在RAG应用中,节点和关系先被嵌入,然后做相似性搜索,找到锚点节点,再通过多跳查询扩展节点,检索相关信息,最后用来增强响应查询的提示。

知识图谱查询

演示案例包括一个PDF文件和一个Excel文件。PDF文件里存了2011年到2021年香港人口规模和结构的信息。Excel文件则包含了2021年到2023年的人口普查记录,比如按年龄组和性别分类的中期人口数据。

用 Docs2KG 工具,可以把PDF和Excel的内容解析出来,再融合成一个统一的知识图谱。通过查询这个图谱,可以很方便地提取到想要的信息。用可视化工具一看,能清晰地看到PDF文件的引言部分提到了2011年和2021年的一些关键事件。

基于语义和结构接近度的信息检索

RAG方法的核心思路是:把更相关的信息直接嵌入到提示中,从而增强大型语言模型的性能。在多模态知识图谱里,相关性通常指节点之间的接近程度——这种接近可以是语义上的,也可以是结构上的。利用语义相似性搜索,通过嵌入模型来检索相关的文本片段、图表这些信息,选出最相关的前k个节点作为锚点。然后,再检索n跳范围内语义和结构上相关的节点,用这些来丰富和优化提示内容。

总结

这篇文章阐述了一个名为Docs2KG的开源架构,它的专门用途是创建多模态知识图谱。和现有技术相比,Docs2KG 框架更贴近实际应用场景,能处理网页、电子邮件、PDF、Excel文件等多种格式的非结构化数据。通过把这些不同来源的数据融合到一个知识图谱里,再把语义和结构化信息加进去,Docs2KG 能以更全面、更精确的方式呈现知识——这无疑增强了知识图谱在不同应用领域中的有效性和可靠性。

关于宇宙的好的网名有哪些
关于宇宙的好的网名有哪些

类型:角色扮演

大小:1

语言:简体中文

平台:互联网

游戏下载

热门手游

手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc