来源:互联网 更新时间:2026-07-23 15:04
最新研究发现,AI幻觉带来的影响比想象中更隐蔽——它不仅能骗过你,还会悄悄膨胀你的自信心,同时削弱你的判断力。
这可不是什么好消息。
最近,来自巴黎高师、罗马第一大学、米兰比可卡大学的研究团队发布了一项有意思的发现:
,人们会更爽快地承认“我不知道”,先把判断放一放;没有AI时
,哪怕人们明明知道它会犯错,哪怕知道答错还要受罚,大部分人还是会选择把它给出的答案照单全收,当成是自己的判断并自信地说出口。但AI一出现
实验数据清晰地呈现了这一趋势:在首个未使用AI的实验中,坦言“我不知道”的人数占比为44%,正确率为27%;
而
即便后续实验试图通过
也就是说,
目前,相关研究成果已发表在arxiv上,团队一共做了5个实验,参与者总数达3132人,其中4个实验预注册,1个是直接复现实验。

这项研究关注的是
研究者Valerio Capraro在接受采访时表示:
对人类来说,说出“我不知道”非常重要,因为这代表我们能意识到自己知识的边界。
但现在,有了AI之后,几乎任何问题都能立刻得到一个流畅答案。
于是问题来了,这会不会干扰人类原本的判断能力?也就是在不确定时,先不急着下结论?
为此,
不是数学推理题,也不是常识题,而是
比如《我爱贝克汉姆》里球队队服是什么颜色?《布达佩斯大饭店》里Agatha的标志性发型是什么?or《高速路上一只猫》里Monica开的是什么车等等。
你有印象吗?这些题目刁钻到读过电影的人恐怕都要愣上半天。

对AI而言,这同样是个头疼的问题,因为
研究者先测试了实验中使用的模型
此外,他们还测试了更多前沿的模型,包括

这些前沿模型确实在部分题目上表现更好,比如《布达佩斯大饭店》里Agatha的标志性发型,GPT-5.5、Gemini 3.5 Flash和Claude Sonnet 4.6都能答出正确方向:crown braid、milkmaid braid;也就是环绕头顶的编发。

△

△

△
再比如《我爱贝克汉姆》里球队队服颜色,它们也大多能抓到白色、红色这些关键信息。
但一到更依赖具体画面记忆、网上文本资料覆盖更少的问题,模型就开始
最典型的是《高速路上一只猫》里Monica开的车。

但

看上去逻辑严谨,合情合理,但这其实完全是模型


△

△

它们不仅仅是简单的不知道,它们还会通过“虚构人物设定、捏造剧情逻辑、补充车辆用途”把错误答案讲得很完整,
这正是AI幻觉最危险的地方——
实验主要由更轻量的Step 3.5 Flash完成,没有都选择Claude、GPT等顶尖模型。
设计6道电影细节题,是研究设计里很关键的一点,因为很多人都知道这类问题AI本来就经常答错、不靠谱。
研究人员称,
如果人们明知道这些答案AI本来就经常答错,但还是照着AI回答,那问题就不只是“合理外包判断”,而是
研究一共分成
前两轮实验,主要看AI建议是否会影响“我不知道”的比例。
结果很明显:
也就是说,
不过,研究者担心这里有个技术干扰,因为Study 1a里,AI工具大约有10%的请求没有正常响应。
所以他们又做了
这次研究者们

Capraro把这个现象称为
接下来,研究者继续问:
于是
这一轮共有812名参与者参与,分成了4组:有无AI建议;有无金钱奖惩。
按理说,虽然钱不算多,但毕竟答错有成本,人应该更谨慎。
但
没有金钱奖惩规则时,AI可用会让“我不知道”的比例从
有金钱奖惩规则时,AI可用仍然会让这个比例从
换句话说:

更关键的是
没有AI时,正确率大约是

这证明有一部分人可能
引入金钱奖惩规则后,正确率有所提升:
没有AI时,
数据显示,在有奖励的条件下,参与者向AI寻求建议的平均次数从

也就是说,
没有AI、没有奖罚钱规则时,参与者的平均信心是
有AI后,参与者的信心直接飙到了
对此,论文里的概括非常直接:


AI正以前所未有的速度融入日常,一个明显的变化是
最典型的场景就是
以前点进一个话题,还得自己顺着评论区、媒体报道、当事人回应一路摸过去,边看边拼时间线,顺便吃几口跑偏的瓜。
发生了什么、谁说了什么、争议点在哪、后续进展如何,全都给你捋好了,甚至还附上了新闻源链接。
确实省事,但也有点微妙…….
它把信息整理得越清楚,我们自己探索来龙去脉的过程就越短,

写东西时

所以
这一轮有853名参与者,
没有金钱奖惩规则时,AI的自动出现会让“我不知道”的比例从35%降到1%,有规则时,从39%降到7%。
正确率也继续受影响:没有AI时,正确率约为27%,有AI、没有激励时,正确率只有7%。
有AI、加上激励后,正确率提升到了

它不再只是那个等你主动打开聊天框才回应的工具,而是变成了系统默认塞给你的“标准答案”。
论文里用了一个词:

可以理解为,
大语言模型有一个根本特点,即
它可以说得很像真的。
论文给出的一种解释是
原本你可能会想:
但AI给你一段看起来很确定的话之后,心理门槛就变成了
于是,
就算答错要罚钱,人也只是稍微警惕些,没法彻底改掉太信任AI的习惯,结果华丽丽被带偏。

这项研究真正提醒我们的,其实不是“AI会幻觉”,这事儿早已不新鲜;而是一个值得警惕的新变化:
过去,人面对一个陌生问题,可能会有三种选择:
但AI加入之后,流程变短了。
中间最重要的一步,即

这也就是为什么论文作者要强调,他们的这项研究看的不是
这比单次答错更深一层,因为它侵蚀的是我们的
当这个报警器失灵,我们便失去了区分“真知”与“看似合理的猜测”的本能。
同时,
这个损失是不可估量的。
论文的作者之一Valerio Capraro在采访中表示:“我非常担心儿童,因为成年人已经学会了批判性思维。但对于基本上出生时就伴随这些系统的儿童来说,
这段话背后藏着更深的忧虑,
所以有机会从小靠着搜索引擎、书本、课堂、争论和试错,先学过一些基础判断能力,再开始使用AI,能够有机会建立起”我不确定”的感觉。
他们做作业、查资料、写文章、理解概念,都可能随手问AI。
如果从一开始就习惯于直接接收答案,而不是先形成自己的判断,再去验证答案,那么

在Capraro看来,解决这个问题
模型公司当然应该改进,比如更好地表达不确定性,减少幻觉,在证据不足时提醒用户。
但同时Capraro也认为,不能把希望全押在模型公司身上。
更有希望、也更长期的解法,是
尤其是
对今天的孩子们来说,
在实验的最后,研究者也坦承了局限:实验仅使用了电影细节题,是否适用于其他领域仍需验证;激励金额较小,更大的利害关系能否进一步纠正行为尚不清楚。
但至少现有的数据已经给出了一个清晰的信号:
这可能是AI时代最隐蔽的一种风险。
这项研究最后给出的判断很克制,但也很沉重:“随着AI生成的答案无处不在,甚至常常不请自来,我们的研究表明,
在人与AI的互动中,人类坦然承认‘我不知道’的能力,可能会成为人机交互中最早的牺牲品之一。
当AI系统日益普及,人类的判断力能否站稳脚跟,最终可能并不取决于让AI变得更精准,而在于我们能否守住那份自知之明——既清醒地认识到自身知识的边界,又能据此审慎行事。”

这不是说AI不能用,恰恰相反,AI当然可以是强大的辅助工具;
但前提是
一个更健康的AI使用方式,可能是
例如:
“它有没有可能是错的?”
“证据在哪?”
“参考链接是否404全空白?”
“我有没有因为它说得太顺,就认为它说得对?”
当证据不足、问题依赖视觉细节、实时信息或专业判断时,AI应当主动告知用户这个答案不可靠,而非强装无所不能。
而对于像你我这样,被时代浪潮裹挟着向前奔跑的普通人来说,最珍贵的能力,也许只是重新练习说出那句:
[1]https://www.theregister.com/ai-and-ml/2026/07/19/using-ai-makes-people-less-likely-to-admit-they-dont-know-something/5274567
[2]https://arxiv.org/pdf/2607.13562
七麦数据官网网页地址 七麦数据官方入口在线首页
问卷星官方网站入口地址 问卷星网页版在线使用
PokePay加密卡2026完整指南:申请开卡全攻略+多场景应用技巧
币安Binance官方中文网站 币安App最新版下载及新手注册指南
闲鱼的严选验货在哪里看?闲鱼严选和验货宝哪个可靠
为何比特币BTC价格跌破7.3万美元?一文拆解影响近期比特币行情的五大原因
摩托车活塞环性能如何
豆包AI专业版使用教程【新手必看】
ThinkBook系列最新价格全解析:2026年选购避坑与实时询价指南
迷你网名古风男生霸气(精选100个)
币圈十大实用工具:从实时行情监控到数据分析、资产管理
文雅简易网名男生可爱(精选100个)
GPT5.6惨遭切脑,Fable 5回归要变弱鸡版?
芝麻开门Gate.io官方网址入口 芝麻开门交易所新手账户注册流程
王者荣耀「西行封妖记」【孙权-仙扇使者】6月25日上线!
闲鱼严选和验货宝哪个可靠?闲鱼的验货宝怎么样,,
精准天气预报APP推荐:支持分钟级降雨预测与实时分享功能
币安杀入美股市场,重头戏bStocks还没来
陈姓和杨姓网名大全男生(精选100个)
网名开头英文名字男生(精选100个)
手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc