来源:互联网 更新时间:2026-07-28 15:11
在医疗这样的高风险领域,大模型“一本正经地胡说八道”可是真要命。如何让LLMs的答案更可靠,一直是行业焦点。这项发表在IJCNN 2024的研究,来自华南师范大学、上海人工智能实验室和上海交通大学,他们提出的REMED框架,或许找到了一个不错的解。
大语言模型(LLMs)在医疗等领域的“幻觉”问题,催生了检索增强生成(RAG)方法。但RAG的效果,很大程度上取决于检索质量。为此,我们设计了一个专门针对医学文档检索的框架——REMED,并在IJCNN 2024上分享了这套方案。REMED整合了数据集构建、高效的嵌入微调模型EM-FT、检索增强生成以及人工评估。其中,EM-FT通过高效的嵌入微调,能对预训练模型的医学句子表示进行端到端优化,大幅提升医学检索的性能。我们用对比学习作为损失函数,让模型能更精准地捕捉查询和文档的相似性。在两个数据集上的验证结果显示,相比直接用嵌入模型检索,我们的方法在MMD上召回率和精确度提升了3.2%到6.0%,在MPD上更是提升了14.4%到42.6%。
GPT-4这类大模型的能力确实惊艳,但它们的“幻觉”问题也让人头疼。尤其是在医疗、法律这些领域,一个微小的错误都可能引发严重后果,信息处理必须慎之又慎。
检索增强生成(RAG)是目前应对幻觉问题的主流方案之一。它的思路很直接:把大模型和外部知识库结合起来,让生成过程有据可查。我们在这项工作中,自主收集了两个数据集:一个是药品信息数据集MMD,一个是医学论文数据集MPD。通过将生成内容与可靠知识库进行比对,生成结果的可靠性有了显著提升。
数据集是研究的基石。我们构建了两个专用的医学数据集:
两个监督数据集的构建流程是重头戏。
上图展示了MMD的结构化细节。简单来说,就是将原始药品数据转化为结构化文本,每个样本包含药品名称、生产厂家、类别和属性等,标签则来自真实世界的标注。
MPD的处理流程则稍有不同:先用论文标题或随机段落作为LLM输入,生成相关查询;再计算每个查询和段落的BM25分数,并据此分配标签。
REMED框架整合了数据集构建、高效的嵌入微调模型EM-FT、检索增强生成以及人工评估四个环节。
我们的方法用监督数据集训练嵌入模型,并引入对比学习来提高性能,成本却很低。在密集检索领域,M3e和E5等嵌入模型是关键。在此基础上,我们加入了一个新模块——Gate Linear Unit (GLU)。EM-FT整合了整个嵌入模型和GLU模块。值得注意的是,微调过程中嵌入模型参数被冻结,训练只集中在GLU模块上。这样做的好处是,既能确保医学数据实时更新,又能防止私有数据泄露。
我们设计了一个对比损失作为监督信号,来优化嵌入空间。目标是让与查询相关的文档在向量空间中更接近,不相关的则更远。
通过将对比学习纳入EM-FT的微调,模型在捕捉查询和文档相关性方面变得更高效,能有效拉近正向文本,推远负向文本。
EM-FT模型架构集成了两个核心组件:嵌入骨干(Embedding Backbone)和可训练的EM头部(Trainable EM Head)。这个紧凑的EM头部设计包含层归一化(LayerNorm)和两个带激活函数的线性层。这里我们提供了两种激活函数选择:GELU和Swish,灵感来自最新的LLM设计进展。
我们用同一个问题“奥利司他胶囊的适应症是什么?”来对比M3e模型和我们EM-FT模型的LLM生成效果。结果一目了然:M3e检索结果不准确,导致LLM给出了错误答案;而我们的方法检索准确,LLM自然也能正确回答。
我们在MMD和MPD两个数据集上,用多个指标进行了全面测评,重点关注前K=10个推荐结果。
从表1可以得出几个关键结论:
从表2可以看到:
综合来看,在医学文档检索方面,引入对比学习和用EM-FT进行向量微调,能显著提升模型性能,同时在计算效率上也表现突出。
这项研究提出了REMED医学文档检索框架,涵盖数据构建、嵌入模型微调、检索增强生成和人工评估。EM-FT作为一种高效的微调方法,能端到端优化大规模预训练模型的医学句子表示。我们收集的MMD和MPD两个监督数据集,也为EM-FT模型微调提供了有力支撑。
REMED框架的关键优势在于确保了数据集的隐私和安全性。我们证明了,提升检索模型前K个结果的质量,能直接提高LLM回答的准确性。当然,目前的工作也有局限,比如二元标注系统(0和1)。未来,将标注细化为0到4的评分,可能会带来更精确的结果。这也正是我们下一步的重点方向。
[1] L. Huang, W. Yu, W. Ma, W. Zhong, Z. Feng, H. Wang, Q. Chen, W. Peng, X. Feng, B. Qin et al., “A survey on hallucination in large language models: Principles, taxonomy, challenges, and open questions,” arXiv preprint arXiv:2311.05232, 2023.
[2] P. Lewis, E. Perez, A. Piktus, F. Petroni, V. Karpukhin, N. Goyal,H. Kuttler, M. Lewis, W.-t. Yih, T. Rocktaschel et al., “Retrieval augmented generation for knowledge-intensive nlp tasks,” Advances in Neural Information Processing Systems, vol. 33, pp. 9459–9474, 2020.
[3] Y. Wang, Q. Sun, and S. He, “M3e: Moka massive mixed embedding model,” 2023.
[4] L. Wang, N. Yang, X. Huang, B. Jiao, L. Yang, D. Jiang, R. Majumder, and F. Wei, “Text embeddings by weakly-supervised contrastive pretraining,” arXiv preprint arXiv:2212.03533, 2022.
为何比特币BTC价格跌破7.3万美元?一文拆解影响近期比特币行情的五大原因
摩托车活塞环性能如何
ThinkBook系列最新价格全解析:2026年选购避坑与实时询价指南
GPT5.6惨遭切脑,Fable 5回归要变弱鸡版?
Ondo将于今日上线股票永续合约
电视剧《罗曼诺夫后裔》剧情介绍
暗黑4S14野蛮人终局BD攻略
《三角洲行动》S10赛季卡邮件技巧详解-三种方法及风险提示
如何在火狐浏览器中彻底禁用自动更新功能?
区块链OTC交易所有哪几家比较正规?
手机qq浏览器误删文件如何找回-手机qq浏览器误删除文件怎样恢复
360浏览器如何设置网页缩放比例
《三角洲行动》GTI超人成就解锁攻略-满辐射状态击杀技巧详解
全链网:戴蒙或继续担任摩根大通首席执行官三年
什么是山寨币?山寨币指数如何查看?全球前10大山寨币盘点
Binance新增15种bStocks代币化证券为杠杆抵押资产
Sophon正在关闭其Layer2区块链并迁移到Base
全球十大加密货币APP v3.11.5正版下载
异环1.2前瞻什么时候
《三角洲行动》ASh-12战斗步枪改装攻略-省钱与击杀方案详解
手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc