来源:互联网 更新时间:2026-08-05 16:43
先说说一个背景判断。信息提取(IE)的目标,是从那些没有固定格式的文本里,把结构化信息给挖出来。而关系抽取,作为IE的一个重要分支,干的就是识别出实体之间特定关系这件事。现有的基于神经学习的方法,在精确度上表现确实不错,但问题也很明显——它总会在召回率这一项上偷偷打个折扣,也就是识别所有相关实体的能力不太够。更麻烦的是,这些方法大多只能处理单个段落,一旦面对长篇文本,比如整本书或多页网页,就有点束手无策了。所以,一个很自然的追问就来了:
就拿主题“哈利·波特”来说吧,目标是从整个系列的书里,把57位朋友全部找出来。这不是一个简单的任务,因为信息零散地分布在几百页纸里。

为了解决这个问题,有一个名为L3X(即基于语言模型的长列表抽取)的方法。它的核心思路,可以拆解为两个阶段:

这一步的关键词是“海选”。做法是:基于当前主题和关系,给大型语言模型(LLM)一个提示,让它尽可能多地生成一个完整的对象列表。同时,通过信息检索系统从长文本里搜罗那些看起来有希望的候选段落,然后把它们喂到LLM的提示里。与以前那些检索增强型的LLM思路不太一样的是,这里会检索大量这样的段落(比如针对某个SPO三元组,可能检索500个),并且会精挑细选其中最合适的段落来给模型做提示。而且,这个过程不是一次性的——它会迭代地对段落重新排序,再让LLM反复生成,从而不断优化初始的对象列表。简单来说,就是先宽进,把能想到的都拉进来,再慢慢筛选。
在第一步拿到了高召回率的候选对象列表后,接下来就是“严出”了。这一阶段的目标是精准验证和修剪。它会采用比较保守的技术,专门识别那些置信度高的对象,找到它们对应的支持段落,同时重新评估那些看起来不太靠谱的候选对象,最终把不够格的剔除掉。
在一个新构建的数据集上做实验,这个数据集包含了10本书和8种不同的关系类型。结果表明,
论文地址:
Recall Them All: Retrieval-Augmented Language Models for Long Object List Extraction from Long Documents
https://arxiv.org/pdf/2405.02732
Ondo将于今日上线股票永续合约
黄金价格不断创新高!黄金稳定币XAU、PAXG市值达11亿美元
晶核艾尔莎角色盘点 晶核艾尔莎强度分析与实战表现
新浪机器学习热点小时报丨2026年07月25日18时_今日实时机器学习热点速递
区块链OTC交易所有哪几家比较正规?
CC币价格预测(2026-2035):Canton币今日价格走势+长期价格预测
新破天一剑太极刀任务攻略 破天一剑怎么取太极刀
Intel喜讯连连:18A工艺良率提升到85%、CPU将涨价15%
合集38个项目筹集5.406亿美元 Figure融资2亿
AMD英特尔集体失眠!英伟达Rosa CPU搭载Rigel核:单核性能碾压x86
遗忘之海密室通关教程 遗忘之海密室全关卡解谜思路与难点解析
五菱星光L六座新能源SUV上市:三版可选,中配12.28
抖音怎么取消申请退货退款?抖音上取消退货怎么操作
蚂蚁庄园今日答案7月21日(今日已更新) 蚂蚁庄园今天正确答案是什么呢
新浪互联网热点小时报丨2026年07月26日16时_今日实时互联网热点速递
macOS 28将移除Rosetta 2兼容层,Intel应用面临运行危机
潜水员戴夫丛林DLC接吻的鱼任务攻略
电视剧《白领公寓》剧情介绍
探索我的世界材质包16x32x64x 解密我的世界材质包16x32x64x的魅力与技术
五千元以下的笔记本几乎消失!经销商:至少一年看不到涨价尽头
手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc