来源:互联网 更新时间:2026-08-27 14:11
大型语言模型的崛起,正在悄然改变我们获取信息的方式。但有没有想过这样一个问题:当越来越多的互联网内容变成AI生成文本,人类原本的创作和观点表达会不会被逐渐“挤”出搜索结果的视野?这篇论文正是从这个角度切入,系统研究了LLM生成文本对检索增强生成(RAG)系统造成的短期与长期影响。它关注的核心现象,可以归结为一个社会学中耳熟能详的概念——“沉默螺旋”。
研究难点在于:LLM生成文本的传播速度极快,搜索引擎的索引会迅速收录它们,并反馈到后续的检索与生成过程中。这种闭环效应如何量化?错误信息如何沿着这个链条扩散?这些都缺乏成熟的评估框架。相关领域的工作已经不少:RAG系统本身的检索机制分析、AIGC对信息生态的冲击研究,以及“沉默螺旋”理论在数字环境下的延伸应用。但将这三者串联起来,系统模拟LLM文本如何一步步侵蚀人类内容地位的研究,此前尚属空白。
为了回答这个问题,论文构建了一套迭代管道,模拟LLM生成文本逐步渗透到检索系统中的全过程。可以把RAG系统看作一个函数,它接受查询集合和文档集合,借助LLM的知识库,最终输出生成文本。整个流程分成两个核心阶段:检索阶段和生成阶段,分别由检索函数和生成函数实现。
模拟从纯人类生成文本的数据集开始,然后分步引入LLM生成的文本,观察RAG系统的表现如何变化。具体步骤是这样的:
这套流程的关键在于:每一次迭代,LLM生成的文本都会成为下一次检索的一部分,形成一种自我强化的循环。
实验选用了开放域问答(ODQA)领域最常用的几个数据集:NQ、WebQ、TriviaQA和PopQA。检索阶段用Acc@5和Acc@20来衡量效果,生成阶段则采用Exact Match(EM)指标。检索和重排方法覆盖了从稀疏模型到密集检索的多条路线:BM25、Contriever、BGEBase、LLMEmbedder等;重排器则包括MonoT5-3B、UPR-3B和BGEreranker。生成模型方面,论文综合使用了GPT-3.5-Turbo、LLaMA2-13B-Chat、Qwen-14B-Chat、Baichuan2-13B-Chat和ChatGLM3-6B,覆盖了主流的中英文大模型。

经过十次迭代后,人类生成文本在所有数据集中的占比都降到了10%以下。换句话说,搜索结果里每十条内容中,可能只有一条是真人写的。随着时间推移,观点的同质化趋势愈演愈烈——检索结果的多样性和准确性双双下滑。

这篇论文通过一套精心设计的模拟实验,揭示了LLM生成文本对RAG系统造成的“沉默螺旋”效应。短期看,LLM文本确实提升了检索的命中率;但长期而言,它正在悄无声息地边缘化人类创作的内容,推高信息的同质化风险。研究呼吁学术界正视这个问题,在享受大模型便利的同时,必须为数字信息环境的多样性和真实性守住底线。
AI辅助人工完成。
腾讯ima怎么把微信内容一键导入知识库?
腾讯ima怎么创建共享知识库?
Celestia价格预测2026-2032:TIA币能否引领山寨币上涨行情?历史价格回顾
比特币(BTC)核心周期指标复刻历史走势 价格或跌破5.8万美元关键支撑位
比特币 2025 年价格预测:BTC 的未来走势
新浪互联网热点小时报丨2026年07月26日16时_今日实时互联网热点速递
WorkBuddy微信版怎么获得积分?
5000元起的鼠标哪个最值得入手?
新浪人工智能热点小时报丨2026年07月30日18时_今日实时人工智能热点速递
腾讯ima知识库怎么分类管理?
短剧《史上最强洪荒修为》剧情介绍
海尔消毒柜自动消毒如何中止
博世壁挂炉关闭暖气怎么操作
男生高性价比充电头?
车载冰箱重置到出厂设置几步?
SPX6900(SPX)币是什么?SPX币价格走势分析及未来展望
管线机怎么接云米净水器
Windy卫星云图怎么看?云层变化识别技巧
WorkBuddy积分怎么获得?
kimi提示词专家使用方法新手指南
手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc