热门搜索:和平精英 原神 街篮2 

您的位置:首页 > > 教程攻略 > ai资讯 >重塑认知科学中的“行为”理解,提升智能体决策能力

重塑认知科学中的“行为”理解,提升智能体决策能力

来源:互联网 更新时间:2026-08-10 15:18

编者按:随着科技的不断进步,人工智能与认知科学的交叉研究已成为推动科学前沿的重要力量。其中,习惯性行为与目标导向行为的相互作用是心理学、认知神经科学和人工智能等领域都十分关注的研究课题,因为从简单的日常习惯到复杂的决策制定过程,都是这两种行为模式交互的体现。为了更好地理解二者间的关系,微软亚洲研究院的研究员们通过引入贝叶斯“意图”变量,将习惯性行为与目标导向行为进行了整合,达到了计算效率和灵活性的平衡。该研究的提出不仅挑战了传统的认知模型,也为未来智能系统的设计提供了新的发展方向。相关论文已在《自然-通讯》(Nature Communications)杂志上发表。

在心理学、认知神经科学和人工智能领域,如何理解并建模人类与动物的行为,一直是个不小的挑战。而其中最引人入胜的部分,莫过于习惯性行为与目标导向行为之间的“交锋”。从日常琐碎的习惯动作,到需要精密规划的战略决策,两种行为模式总是在暗中博弈。传统观点倾向于将它们分而治之:习惯性行为像自动驾驶,高效、无脑、不假思索;而目标导向行为则像手动驾驶,缓慢、灵活、步步为营。

重塑认知科学中的“行为”理解,提升智能体决策能力

有意思的是,微软亚洲研究院与冲绳科学技术大学院大学的研究者们,最近用一套变分贝叶斯方法,把这个旧认知给“掀了桌子”。他们提出一个新颖的理论框架,硬是把这两种看似各走各路的行为给整合到了一起。这件事的意义,不只是给人工智能系统设计打开了新思路,连带着对神经系统的底层运作机制,也有了更深刻的理解。

图1:习惯性行为(专注工作时吃零食)和目标导向行为(计划一顿减肥餐)的不同特征

相关论文已经发表在《自然-通讯》上,有兴趣的话可以直接去搜来看:

Synergizing Habits and Goals with Variational Bayes

习惯性行为和目标导向行为间的协同作用

这个被命名为“贝叶斯行为”的框架,核心做法并不复杂:用一个贝叶斯“意图”变量,把习惯和目标导向行为串起来了。习惯性行为,源自感官输入计算出的意图先验分布——它不需要一个明确的目标,更像是经验直觉。而目标导向行为,则是由一个目标条件意图后验分布所引导——这个后验分布,是通过最小化变分自由能推断出来的。换句话说,一个是提前的“预判”,一个是事后的“纠偏”。

研究者的核心观点是:习惯性行为和目标导向行为,不应该被割裂对待。它们共享神经通路,可以互相取长补短。举个例子,习惯性行为虽然死板,但通过反复练习,能提供一套极其熟练的运动技能;而目标导向行为呢,正好可以借用这套技能,去完成更复杂的规划任务。这种协同,靠的是两种机制:第一,最小化先验(习惯)与后验(目标导向)意图之间的差异;第二,通过逆方差加权平均,将两者合并成一个“协同意图”,智能体再拿这个意图去行动。

图2:(a) 贝叶斯行为框架概述;(b)和(c) 学习过程中和行为过程中的框架图

模拟实验:智能体行为模式的转变、调整与零样本规划能力

光说理论不够,研究者们在T形迷宫环境里做了视觉引导的感知运动任务模拟。实验结果令人信服,与神经科学和心理学实验的观察数据完美吻合,主要体现在三个方面:

1. 从目标导向到习惯性行为的过渡

:模拟实验表明,当智能体反复执行同一任务时,它的行为会自动从缓慢的目标导向模式,切换到更快的习惯性模式。这个切换的开关,是习惯性意图精确度的持续增加,这直接减轻了目标导向规划的计算负担。

2. 奖励贬值后的行为变化

:模拟实验还模拟了“结果贬值”的情境,也就是奖励变化时智能体如何调整。结果发现,训练量越大,智能体在习惯性行为上的“顽固性”就越强,这一点与心理学研究里人类的表现如出一辙。

3. 零样本目标导向规划

:最惊艳的一点是,这个框架允许智能体在没有任何额外训练的情况下,直接处理新目标。它靠的是对现有习惯性行为的灵活调用,做到“即插即用”。

图3:经过训练的智能体 (a-c) 可以针对未见过的目标 (d, e) 执行目标导向的规划(例如看见更多的蓝色)

认知神经科学视角下的智能体决策机制

当一个智能体面对复杂任务,它需要在内部模型里对环境和经验做预测和规划。关键问题来了:它如何在习惯性和目标导向行为之间做取舍?又是怎么从缓慢的目标导向自主过渡到快速的习惯性行为?

“取舍”是如何实现的?


研究者指出,智能体通过逆方差加权平均,把先验和后验意图揉成一个协同意图。这个方法的精妙之处在于,它用意图分布的统计方差,自然地衡量了行为的不确定性。而且,智能体在训练过程中,可以通过最小化自由能和强化学习损失,动态地调节这个平衡——说白了,系统会自己找到最划算的那个点。

“过渡”是如何自动发生的?


模拟实验显示,在适应新任务时,习惯性意图的方差一开始很大;但由于无模型决策简单直接,随着重复试验的增加,方差会快速缩小。方差一缩小,平衡自然就滑向习惯性意图。研究者还设计了一个机制:当协同意图足够精确时,智能体可以提前停止目标导向的主动推理,省下计算资源,精度却不打折扣。这就解释了为什么练得多了,人就容易“凭感觉”而不是“动脑子”。

“零样本规划”如何实现?


智能体需要配一个内部预测模型,通过模型搜索和规划出目标导向意图。而这个目标导向意图,是在习惯性意图的约束下推断的。这个约束确保了规划的有效性——不去搜索那些完全违背习惯的路径,同时充分利用了习惯性行为里沉淀下来的运动技能。最终,智能体能高效地将目标导向行为泛化到新目标上。

探索智能体行为的计算框架新范式

微软亚洲研究院的这项研究,可以说是对认知科学意义上“行为”的一次重新定义。他们用一个贝叶斯框架,把习惯性和目标导向行为捏合到一块儿,构建出一个既兼顾效率又不失灵活性的模型。这件事的后续想象空间很大:比如,把强化学习和主动推理结合,能显著增强自主智能体在复杂环境里的决策能力;再比如,深入理解两种行为的相互作用,不仅有助于揭示神经系统的运作逻辑,还可能为某些疾病的治疗策略提供线索。

可以确定的是,这种跨学科的创新力量,正在一步步改变我们对智能的认知。

关于宇宙的好的网名有哪些
关于宇宙的好的网名有哪些

类型:角色扮演

大小:1

语言:简体中文

平台:互联网

游戏下载

热门手游

手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc