热门搜索:和平精英 原神 街篮2 

您的位置:首页 > > 教程攻略 > ai资讯 >如何提升大模型推理能力

如何提升大模型推理能力

来源:互联网 更新时间:2026-08-27 14:30

最近关于大模型推理能力的话题讨论越来越深入。一个核心判断是:现在的大模型像是“茶壶里煮饺子”——从预训练中学了很多东西,但简单粗暴的采样推理方式反而限制了它能力的有效输出。

如何提升大模型推理能力

正如之前讨论过的,大模型技术日新月异,即使它永远不会停止幻觉,未来的方向也必然是通过专业系统验证输出,用针对特定场景优化的人工智能工具取代部分通用模型。最关键的改进路径是:引导大模型学习人类特定的先验知识,更好地理解“范畴的结构和关系”,优化范畴内和跨范畴的采样算法,将幻觉压缩到“不可见”的范围——尽管很难彻底消除为零。

近期行业的动向印证了这一判断。Cohere创始人接受《时代》周刊采访时直言:“AI模型还没有真正的问题解决能力,因为训练语料里很少有记录人类推理过程的数据。所以像Cohere、OpenAI和Anthropic这些领先公司,都在想尽办法搜集展示人类推理过程的训练数据。”

事实上,此前的研究已经证明GPT对知识有强大的记忆能力。而增强推理能力的方法主要有两条:一是提供提示语或提示样本,二是在预训练中引入代码样本。ChatGPT强大的推理能力,被认为很大概率来自代码参与其预训练。代码本身就是一种设计完善的特殊语言——结构性强、长程关联、关系明确。GPT可以用自己构建的高维语言空间,方便地学习代码这种特殊的结构。

二.释放大语言模型推理潜力

1. 语言模型可以发展出自己对“现实的模拟”,并以此提高生成能力

MIT计算机科学和人工智能实验室(CSAIL)的学者最近分享了一项有趣的研究成果[文献1],发现语言模型可以发展出自己对“现实的模拟”,并以此来提高生成能力。这里用“现实的模拟”而不是“世界模型”,可能就是因为后者容易让人误解为无所不包的东西——其实它指的是对真实世界具体场景的模拟。

在对超过100万个随机谜题进行训练后,模型竟然自发发展出了底层的模拟概念,尽管在训练过程中从未直接接触过这种现实。这为我们提供了一个重要的起点:LLM是否真的能理解文本?从结果看,它们的能力远远超过“盲目地拼接单词”。那些还在强调大模型是“随机鹦鹉”的所谓著名学者,可能已经很久不读论文了。

实验设计的巧妙之处在于:计算机代码和自然语言一样,既有语法又有语义,但与自然语言不同的是,代码的语义可以直接被观察和操纵。这正如我们之前讨论过的——代码是最好的展示人类思维推理过程的载体,也是为什么经过代码训练的大模型在推理能力上有了质的飞跃。

2. 大语言模型可以作为时间序列的零样本异常检测器

大语言模型能够执行的任务远超语言本身,包括时间序列预测。这种灵活性正是“通用”的本来意义。

[文献2]将LLM应用到了更具挑战性的时间序列异常检测任务上。模型需要将输入序列中的部分片段识别为异常——但它处理的不是文本,而是时间序列数据。作者设计了一个完整的框架:包括时间序列到文本的转换模块,以及提示语言模型执行检测的端到端流水线。

实验结果显示,虽然目前最先进的深度学习模型在性能上仍然略胜一筹,但通过合理运用大模型预测下一个token的生成方式,LLM在未经任何特殊训练或微调的情况下,就能直接发现时间序列中的异常——这本身就是很值得关注的结论。

3. 生成式AI还可以执行基本的结构生物学建模

基于自然语言的生成式AI在科学研究中的应用越来越普遍。有趣的是,GPT等大语言模型的能力已经被证明超出了自然语言任务的范围。

[文献3]探讨了如何通过GPT4执行基本的结构生物学建模。作者让GPT4对20个标准氨基酸和一条α螺旋多肽链的3D结构进行建模,后者还结合了Wolfram数学计算。此外,还完成了抗病毒药物nirmatrelvir与其靶点SARS-CoV-2主要蛋白酶之间的结构相互作用分析。分析结果显示,GPT能识别参与配体结合的特定氨基酸残基以及相应的键距。尽管目前仍有局限,但这项研究展示了大语言模型已经具备以原子级精度执行基本结构生物学建模的能力。

三.使用数据因果模型进行探测

随着LLM在大量NLP任务上表现越来越强,分类探测器已成为理解其内部工作原理的重要工具。典型的做法是:先定义一个辅助任务(比如带有标签的文本数据集),然后训练一个小型分类器,在处理数据时从预训练LLM的表示中预测标签。高探测精度通常被解释为:LLM已经学会了辅助任务,作为其原始预训练目标的无监督副产品。

[文献1]的学者采用结构因果模型(SCM),提出了一个正式的研究框架,称为“潜因果探测框架”。这个框架通过对模型的训练数据进行干预,并测量对语言模型内部表示的因果效应。它为通过因果分析解释实验结果提供了强大工具,特别是能严格控制探针在学习辅助任务中的贡献。在实验中,学者们扩展了关于Transformer能否推断出一系列动作背后中间状态的研究。研究结果提供了强有力的经验证据:大语言模型确实能从文本预训练中推导出潜在概念。

四.Nature:持续深度学习中的可塑性丧失

人脑就像一块海绵,能不断吸收新信息,并为此腾出空间——这就是大家熟悉的“可塑性”。那么,LLM同样具有可塑性吗?OpenAI的GPT-4o已经开放了fine tune功能,但增量训练是否总是有效?有充足计算资源的情况下,学习能力是无限的吗?

最近Nature上发表的来自艾伯塔大学的研究发现了一个关键问题:基于深度学习的人工神经网络在对新数据进行长时间、按顺序训练时,会逐渐失去学习能力,即可塑性丧失[文献5]。用更直白的话说:梯度下降的边际效用递减。

学者们同时提出了解决方案:通过重置网络节点上已经关联的权重。在人工神经网络中,权重决定了节点之间的信号传递强度——权重可以通过信号获得或失去强度,而信号又受到数学计算结果的影响。权重越大,它所传达的信息的重要性就越高。研究者建议,在训练会话之间,重新初始化那些使用频率最低的单元的权重,采用与初始化系统时相同的方法,就能让系统保持可塑性,继续在额外训练数据集上学习。这个新算法被称为“连续反向传播”。

这个发现很符合学习过程的直觉。所谓“温故而知新”,要达到最佳效果,在温故之前需要把那些较少被关注的前提不断随机重置,才能更好地知新。这背后是否涉及重整化流中微扰带来的新对称性破缺?值得进一步思考。

五.大语言模型的可解释性令人着迷

科学家们正在尝试打开生成式AI的黑匣子,开始了解模型的内部工作原理。这个方向的重要性不言而喻:与使用固定规则的计算机程序不同,GenAI模型在海量数据中寻找模式,并为同一个输入产生多个可能的答案。进一步的研究有助于开发更好的模型幻觉保护措施,并防范自主AI智能体可能带来的风险,比如欺骗或操纵。

Anthropic的研究人员在五月底宣布了一项重要突破——让我们能更多了解AI语言模型的内在工作原理。OpenAI也做过类似的研究,但两家的工作范围都受限。Google DeepMind则试图在最近发布的Gemma Scope中解决这个限制——这个工具可以查看Gemma 2模型所有层的特征,涵盖三千万个特征。Gemma Scope是数百个免费开放的稀疏自动编码器(SAE)的集合,适用于Gemma 2 9B和Gemma 2 2B。

到目前为止,可解释性社区在理解小型模型(使用稀疏自动编码器)以及开发相关技术方面取得了巨大进展,比如因果干预、自动电路分析、特征解释和评估等。新工具可以帮助分析更复杂的功能(比如思路链CoT),并找到可解释性的实际应用——例如解决只有在大模型中才会出现的幻觉和越狱等问题。

总结来看,我们需要避免将算法的学习能力与其生成信息的能力相混淆。核心方向仍然是:想尽办法搜集展示人类推理的数据(比如良好注释的代码),通过引导大模型学习人类特定的先验知识,更好地理解范畴的结构和关系,优化采样算法,从而提升推理生成能力、降低幻觉,让大模型在严谨性要求较高的场景下尽早造福人类。

关于宇宙的好的网名有哪些
关于宇宙的好的网名有哪些

类型:角色扮演

大小:1

语言:简体中文

平台:互联网

游戏下载

热门手游

手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc