来源:互联网 更新时间:2026-08-13 13:45
在数字化浪潮席卷各行各业的今天,档案管理领域正经历一场深刻变革。随着ChatGPT等大语言模型的出现,从数字化向智慧化的转型不再是远景,而成为现实。RAG技术与LLM的结合,为档案领域的智慧应用场景开拓提供了全新动力——这背后,是燕山大学档案馆(校史馆)与河北科怡科技开发有限公司、南京兰征信息科技有限公司联合打造的实战项目。
RAG技术之所以被提出,归根结底是为了解决预训练语言模型在处理知识密集型NLP任务时面临的几个关键挑战。
尽管LLM能存储大量知识,但训练数据终究有限,只能记住当时所见所学。一旦遇到模型从未见过的知识点,结果往往不尽如人意。
外部世界日新月异,知识在不断更新迭代。但预训练模型一旦“毕业”,知识就定格在了那一刻。要想更新,就得推倒重来,重新进行大规模预训练——耗时耗力,成本极高。
生成式任务中,模型经常输出看似流畅、实则不准确甚至虚构的内容。这就是所谓的“幻觉”问题,根源在于模型缺乏对特定事实的直接访问能力。
用户希望理解模型的判断依据,尤其是在涉及事实信息的场景。纯粹的预训练模型很难提供生成结果的决策逻辑,仿佛一个“黑箱”。
RAG+LLM的核心思路,是将LLM的生成能力与信息检索技术深度融合,从而提升模型在处理各类问答任务时的精确度和可靠性。其运行流程通常包含三个阶段:检索、生成与增强。
当用户提问时,系统首先从外部知识库中搜索关联信息。这一步要把问题转化为查询指令,借助向量空间模型之类的检索模型,找到最相关的文档或信息片段。
检索到的信息会连同原始问题一起喂给LLM,为其提供额外的上下文支撑。这样一来,模型能更准确地理解问题,生成的回答也更丰富、更靠谱。
RAG框架还包含对检索和生成过程的持续优化,比如对检索结果进行重排序、上下文压缩、模型微调等,旨在让整个系统的表现更上一层楼。
简而言之,RAG利用外部知识库来补充和强化LLM的内在知识储备,让模型有能力应对超出训练数据范围、或需要最新信息的任务。
以上所说的是基于端到端训练方法的
LLM通过RAG获得了领域知识扩展,在特定任务上表现更佳,落地难度和成本也随之降低。这为档案领域引入LLM应用提供了理想的切入点。
RAG技术能帮助LLM更准确地理解查档用户的问询,提供更精确、更相关的信息。这样一来,用户既享受到LLM的生成能力,又保障了档案知识的本地安全。
基于RAG+LLM构建档案智能问答系统,是档案智能化应用的重要方向。系统的原理图如下所示:
整张原理图可拆解为三大模块,共涵盖15个步骤(step1-step15)。
这是构建档案知识库的第一步。关键在于确保收集的数据质量过硬——不能有错误、偏见或不准确的信息。数据质量直接决定系统生成的答案是否靠谱。
原始数据通常夹杂噪声和不规范内容,需要“洗澡”提升质量。这项清洗工作量大且繁琐,既依赖数据处理工具,也离不开大量人工参与。数据预处理的质量同样至关重要,会直接影响后续大模型的问答效果。
将档案长文本切分成适合模型处理的小块,同时保证每个文本块的语义独立且完整。处理档案数据时,要根据文本的结构和内容特性来制定切分规则。切分点应尽量尊重自然语言中的语义单位,比如句子、段落或意群,确保每个片段语义完整,避免将一个完整意群拦腰截断,造成信息丢失或不连贯。
检索模块是连接档案知识库与用户查询的关键枢纽。向量数据库的构建、检索算法的选择与优化,是确保高效、精准检索的核心技术。
这是检索模块的基础。需要将档案知识库中的所有文本块转换为向量表示,一般选择一个合适的向量化模型,比如bge-large、bce或text2vec,将文本块转换为固定维度的向量,再存储在向量数据库中,以便后续检索操作。
算法选择直接决定检索模块的性能。常见算法包括BM25、TF-IDF和混合检索等。BM25会根据文档长度对检索结果加权,TF-IDF则结合词频与文档频率进行加权——各有侧重,适合不同场景。
生成答案模块负责将检索到的档案信息整合为用户能理解的回答。查询重构、结果重排序和语义理解是其中的关键环节。
这一步是为了提升检索效果。用户提出的原始问题可能含糊或不精确,查询重构就是通过扩展语义,让问题更精准,或与知识库中切分的文本长度对齐,从而提高检索的相关度。
向量数据库与向量化的查询文本进行相似度计算后,可能返回多个候选答案。需要将这些结果按相似度重新排序,选出最靠前的几个。
将排序后最靠前的结果输入LLM,让它利用生成能力,基于用户问题输出答案。过程中可能涉及端到端微调或对比学习等多种优化方法。
除了上述三大模块,安全访问控制也值得一提。在档案系统设计中,要根据用户角色分配不同访问权限,并通过身份认证确保数据访问安全。在档案智能问答系统中,借助RAG技术结合原有的档案系统角色权限,可以限定某个角色所能访问的知识库范围,从而实现了基于角色权限访问控制的RAG+LLM技术应用。
在燕山大学档案馆(校史馆)的实际项目中,我们基于RAG+LLM构建了档案智能问答系统,取得了良好的应用效果。
CPU:Intel Xeon Gold 6271C *2
GPU:Nvidia Geforce RTX 4090*4
内存:256G
基座大模型:零一万物Yi-34b-chat
向量化模型:bge-large
开发框架:LangChain
档案智能问答系统是我们将大模型融入档案智能化应用的一次初步尝试,涉及档案知识库构建、检索模块开发、答案生成以及安全访问控制等多个方面。从实际测试效果来看,RAG技术与大模型的结合为档案问答系统的智能化提供了有力支撑。受限于篇幅,本文只能对基本原理和系统框架做简要介绍,实际开发过程中碰到的困难和挑战远不止这些,后续有机会再和大家详聊。我们也在不断探索和优化解决方案,以期实现更好的应用效果。
黄金价格不断创新高!黄金稳定币XAU、PAXG市值达11亿美元
新浪机器学习热点小时报丨2026年07月25日18时_今日实时机器学习热点速递
CC币价格预测(2026-2035):Canton币今日价格走势+长期价格预测
新浪互联网热点小时报丨2026年07月26日16时_今日实时互联网热点速递
腾讯ima怎么把微信内容一键导入知识库?
腾讯ima怎么创建共享知识库?
今日比特币暴涨分析:Metaplanet的比特币BTC投资推动股价上涨17%
蚂蚁庄园今日答案7月21日(今日已更新) 蚂蚁庄园今天正确答案是什么呢
新浪人工智能热点小时报丨2026年07月30日18时_今日实时人工智能热点速递
2026热门直线加速赛车手游推荐:高人气、爽快加速体验的精品榜单
Intel喜讯连连:18A工艺良率提升到85%、CPU将涨价15%
Windy卫星云图怎么看?云层变化识别技巧
kimi提示词专家使用方法新手指南
原神霜月三处月灵龛具体位置汇总
《幻兽帕鲁》不触发通缉捕捉传说商人方法
短剧《史上最强洪荒修为》剧情介绍
9条破亿视频,新号涨粉百万,过去半年谁在制造AI爆款?
为什么推特KOL都在BRC20赚钱 我一冲就亏?
抖音怎么取消申请退货退款?抖音上取消退货怎么操作
炼金工房新作或能吃成“良子” 想让女主越吃越丰满
手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc