热门搜索:和平精英 原神 街篮2 

您的位置:首页 > > 教程攻略 > ai资讯 >哈佛和微软亚洲最新发布:rSTAR,让小模型也能成为推理高手

哈佛和微软亚洲最新发布:rSTAR,让小模型也能成为推理高手

来源:互联网 更新时间:2026-08-24 14:01

即便是目前最顶尖的大语言模型,在复杂推理任务面前也时常显得力不从心。更让人头疼的是,那些更轻量级的小模型(SLM),在这方面更是捉襟见肘。但偏偏,边缘设备、近端设备对SLM的需求又越来越迫切。一边是强烈的需求,一边是略显平庸的表现,这个矛盾就成了摆在AI研究者面前的一道难解之题。 不过,最近的一项研究带来了一个让人眼前一亮的答案。由哈佛大学和微软亚洲研究院联合提出的**rStar**方法,用一种巧妙的方式,为这个难题打开了一扇窗。它不仅理论上有新意,实际效果也相当惊人——用的都是常见的小模型,方法本身也有很强的泛化能力。 *图片由修猫创作* 这里可以顺带提一句,研究者的效率确实值得关注。rStar这篇论文发表的时间点很有意思,它引用了7月30号斯坦福和剑桥那篇关于“大语言模型猴子”的论文——后者强调了通过重复采样来提升决策质量。而rStar在8月12号就亮相了,前后不到两周。这种效率,很值得反思。这篇被引用的文章核心在于指出,采用多次采样策略能显著提升推理性能,而rStar正是借用了类似的思想,通过多次MCTS rollout来生成多样化的推理路径。 ### rStar:无需微调的推理能力提升 rStar的核心理念,用大白话说就是**“自我对弈,互相推理”**。它的神奇之处在于,不需要对模型进行微调,也用不着搬出更强大的模型,就能让SLM的推理能力上一个台阶。方法将推理过程拆解为“生成-判别”的双重机制,既激发了SLM的潜力,又绕开了它固有的短板。 为了更直观地展示效果,研究团队准备了一张对比图,展示了不同模型和方法在GSM8K数学推理任务上的表现。 **基线性能:** 先看看各模型的“底子”怎么样: - LLaMA2-7B使用Few-shot CoT的基线性能只有12.51%,充分暴露了小模型在复杂推理任务上的先天不足。 - Mistral-7B稍好一些,基线性能是36.46%,但提升空间依然巨大。 - LLaMA3-8B-Instruct则达到了74.63%,说明指令微调对推理能力确实有立竿见影的效果。 **微调方法的效果:** 专门针对数学推理的微调方法(如MathScale、MetaMath)也确实能带来巨大提升。比如LLaMA2-7B经过MathScale微调后,准确率从12.51%飙升至66.3%。不过,微调的效果在不同模型上差异很大,对那些本来就表现不错的模型(如LLaMA3-8B-Instruct),微调带来的增益就相对有限了。 **rStar的卓越表现:** 这才是真正的亮点。在所有测试的模型中,rStar都实现了显著的性能提升,而且全程不需要微调: - 对于LLaMA2-7B,rStar将其准确率从12.51%一举提升到63.91%,几乎追平了专门微调的效果。 - 对于Mistral-7B,rStar的表现甚至超越了所有微调方法,达到了81.88%。 - 对于LLaMA3-8B-Instruct,rStar更是将准确率推高到91.13%,把其他方法远远甩在身后。 **GPT-4的参考性能:** 图中还标注了GPT-4的性能(约91.13%)作为参考标杆。这里最令人印象深刻的就是,rStar竟然让LLaMA3-8B-Instruct达到了与GPT-4相当的水平。这张对比图,可以说已经把rStar的价值展现得淋漓尽致。 **创新的MCTS生成器** rStar的第一个关键组件,是**基于蒙特卡洛树搜索(MCTS)的生成器**。它通过模拟人类思考时的各种行为,极大地扩展了SLM探索解决方案的空间。 研究团队为此设计了五种推理动作,每一种都对应着一种解决问题的思路: 1. 提出单步思考 2. 提出剩余的思考步骤 3. 提出下一个子问题及其答案 4. 重新回答子问题 5. 重新表述问题/子问题 这些动作的价值在于,它们模拟了人类解决问题时的多样化思维路径,还能根据当前的推理进度灵活选择最合适的行动。这让SLM能够更全面、更深入地探索整个问题空间,生成高质量推理轨迹的可能性自然就大大提高了。 **互相一致性判别器** rStar的第二个关键组件,是**基于互相一致性的判别器**。这个设计的灵感,其实源于我们人类在缺乏正确答案的情况下如何判断——通常是找个人商量一下,互相验证一下。 在rStar中,研究者引入了另一个能力相近的SLM作为判别器。它会为生成器产生的每一条推理轨迹提供“无监督”的反馈。具体做法是: 1. 随机从某条推理轨迹中选取一个步骤作为起点。 2. 将起点之前的步骤作为提示,交给判别器。 3. 让判别器自己完成剩余的推理。 4. 对比判别器得出的结论,与原始轨迹的结果是否一致。 这个方法妙就妙在,它降低了判别的难度。如果两个SLM在互不知情的情况下得出了相同的结论,那么这个结论正确的概率自然就高了很多。 **rStar的工作流程:从生成到验证的全过程** 为了更好地理解rStar是如何工作的,我们分两个阶段来看。 **阶段1:自生成候选解决方案** 一个SLM(称为SLM1)作为生成器,负责“头脑风暴”,生成尽可能多的解决方案。比如面对问题:“约翰买了3大袋M&M豆来分装。如果每个小袋中装10个M&M豆,他能制作多少个小袋?” SLM1会生成多种不同的推理过程,有的可能正确,有的可能包含错误。这种多样性,是后续验证的基础。 **阶段2:互相推理验证** 另一个SLM(称为SLM2)作为判别器登场。它拿到SLM1生成的某条轨迹的一部分,以此为线索,尝试完成整个推理过程。然后,将SLM2的输出与SLM1的原始方案进行比对。如果两者得出了一致的结论,这条轨迹就被认为是“互相一致”的,可信度自然就高了。 **最终答案选择** 通过验证的解决方案,会被选为最终答案。整个流程的核心优势包括:**多样性探索**(增加找到正确答案的几率)、**自我验证**(模拟人类的“二次检查”)、**无需外部知识**(全部在模型自身知识范围内完成),以及**提高可靠性**(通过互相验证来过滤掉单个模型的错误)。 ### 实验结果:令人瞩目的性能提升 rStar的效果,在五个不同的SLM和五个不同的推理任务上得到了充分验证。 **GSM8K:数学推理的里程碑** 在GSM8K数据集上,rStar的表现堪称惊艳: - **LLaMA2-7B**:从12.51% 提升到 63.91% - **Mistral-7B**:从36.46% 提升到 81.88% - **LLaMA3-8B**:从47.23% 提升到 85.52% 这些提升已经接近甚至超越了通过领域专门微调后的水平。尤其是Mistral-7B,使用rStar后甚至比经过微调的MetaMath模型还高出4.18个百分点。 **其他任务:全面的能力提升** rStar的泛化能力同样出色,在多种推理任务上都表现出了强劲的实力: - **GSM-Hard**:最高提升12.9个百分点 - **MATH-500**:最高提升9.14个百分点 - **SVAMP**:最高提升26.8个百分点 - **StrategyQA**:最高提升8.43个百分点 这些结果充分证明了rStar不仅在数学推理上拔尖,在常识推理领域也同样有效。 ### 深入解析rStar的工作原理 那么,rStar究竟是如何实现这些惊人结果的? **问题形式化:多步推理生成** rStar将推理问题看作是一个多步生成任务。相比传统的思维链(CoT),它能把复杂问题分解成更简单的子任务,这对SLM来说显然更友好。它使用MCTS算法来构造一棵搜索树:根节点是原始问题,边代表一个推理动作,子节点是中间步骤,而从根到叶的路径就是一个完整的候选解决方案。 这个过程中的核心是**UCT公式**,它在“利用”(选择当前看来最好的动作)和“探索”(尝试可能被低估的动作)之间寻找平衡。通过这个公式,MCTS能有效地在有前景的路径上深耕,同时也不放过任何潜在的好选择,从而在有限的计算资源内找到更优解。 **MCTS生成器:丰富的动作空间** rStar的MCTS生成器最大的创新,就在于那个包含了五种核心动作的“动作空间”。我们再来详细看看这五种动作: 1. **提出单步思考(A1)**:让模型生成下一个思考步骤。这比一口气生成整条思维链要简单得多,有助于做出更靠谱的决策。 2. **提出剩余的思考步骤(A2)**:类似标准的CoT,当模型对问题比较有把握时,可以直接跳到最终答案。这是一种“快思考”模式。 3. **提出下一个子问题及其答案(A3)**:受“从少到多”提示方法的启发,将复杂问题分解为一连串更简单的子问题,一一击破。 4. **重新回答子问题(A4)**:考虑到之前回答的子问题可能有误,此动作允许模型使用少样本CoT方法重新作答,提高准确率。 5. **重新表述问题/子问题(A5)**:当模型可能误解了问题时,通过换一种更简单的表述,把所有已知条件清晰地列出来,帮助模型重新理解。 **奖励函数:SLM定制的评估方法** rStar为SLM量身定制了一个简洁但有效的奖励函数。它避免了让SLM做它不太擅长的“自我评估”,而是根据每个动作对最终正确答案的贡献来打分。初始时,所有未探索节点的奖励值设为0;当模型到达第一个终端节点时,根据是否算对答案来计算奖励,并将其反向传播给路径上的所有中间节点。终端节点的奖励值则采用自一致性多数投票的置信度。这样,那些频繁引导模型走到正确答案的动作,就会获得更高分数,并在后续的树搜索中更受青睐。 **互相一致性判别:创新的验证机制** 这个机制是rStar的另一大特色,它避免了训练一个专门的奖励模型,从而躲开了过拟合等复杂问题。其步骤如下: 1. 对于生成器产出的每一条推理轨迹,随机选一个点,将其一分为二。 2. 前半部分作为提示,喂给判别器SLM。 3. 判别器独自完成剩余的推理。 4. 比对判别器的结果与原始轨迹是否一致。 5. 如果一致,则认为这是一条有效轨迹,可用于最终决策。 这种方法就像让两个考生各自做同一道题的后半部分,如果他们答案一样,那正确答案的可能性就极高。 ### rStar的MCTS生成器 让我们通过一个具体例子,看看MCTS生成器是如何工作的。 **问题示例**:有多少个两位数质数,其数字之和等于8? **五种核心推理行动**: - **提出单步思考(A1)**:比如,“枚举从11开始的两位数质数。” 这种方式让模型可以像人类一样,一步步推进。 - **完成剩余思考(A2)**:比如,“让我们一步步思考。我们关注两位数...” 当模型思路清晰时,这种方式更高效。 - **提出子问题并回答(A3)**:比如,“哪些是两位数质数可能的数字之和?” 这模拟了分解问题的过程。 - **重新回答子问题(A4)**:允许模型重新思考之前的子问题,修正错误。 - **重新表述问题(A5)**:比如,“该数是两位数质数。数字之和是8。有多少这样的数存在?” 换个角度理解问题,有时能豁然开朗。 **MCTS树的构建过程**: - **根节点**:就是原始问题。 - **展开**:MCTS通过选择不同的行动来长出树枝。有的分支可能直接枚举质数,有的分支可能分析数字组合,还有的分支会重新定义问题范围。 - **多样性探索**:有的分支深入具体计算,有的分支则进行更抽象的推理。 这种设计的优势在于: - **全面性**:通过多种行动,从各个角度探索问题空间。 - **灵活性**:能适应各种不同的推理任务。 - **模拟人类思维**:分解、重构、验证,样样都像。 - **提高效率**:在宏观和微观层面来回切换,更有效地利用计算资源。 - **克服局限性**:对于SLM来说,一次生成整条推理链太难了,但通过多步骤、多角度探索,它就能逐步构建出复杂的推理过程。 ### rStar的优势:全面的分析 相比于现有方法,rStar的优势何在? **对比现有方法**: - **单轮推理方法(零样本/少样本CoT)**:rStar在所有任务上都远胜一筹,证明了多轮推理的巨大优势。 - **多轮提示方法(如自一致性)**:自一致性在数学题上还行,但在需要逻辑推理的任务(如StrategyQA)上就表现不佳。而rStar在所有任务上都保持了高水准。 - **自我改进技术(如RAP、ToT)**:这些方法有效果,但离rStar仍有差距。比如在GSM8K上,rStar比RAP高出2.88%-16.39%,比ToT高出10.60%-38.37%。 **生成器的有效性**:即使不用判别器,光靠MCTS生成器就能大幅提升SLM的准确率,这证明了其动作空间设计的有效性。例如在GSM8K上,仅用生成器,rStar就比RAP高出1.69%-7.34%。 **判别器的重要性**:研究团队比较了不同判别方法。结果显示: - **多数投票**:最简单,但效果有限。 - **自我验证**:比多数投票好,但不如rStar的互相一致性判别。 - **rStar的互相一致性判别**:在所有任务上都是最佳方案。 值得注意的是,即使判别器的模型比生成器还弱,rStar依然能有效验证答案,这说明互相一致性的设计理念非常扎实。 **计算效率**:虽然rStar需要多轮推理,但效率仍然很高。研究显示,只需2轮rollout,就能看到显著效果。这意味着在实际应用中,可以通过调整rollout次数来平衡性能和成本。 ### rStar的潜在应用 rStar的意义远不止于学术论文里的数据,它为SLM在真实世界中的普及打开了新的局面。 1. **提升小型设备的AI能力**:这对边缘计算和物联网来说是个福音。在智能手机、家用机器人上部署强大的AI变得可行,而不用事事都依赖云端的大模型。 2. **降低AI应用的成本**:训练和部署大模型成本高得吓人。rStar通过提升小模型的能力,给企业和开发者提供了一个性价比极高的选择,尤其适合预算有限的中小企业和创业公司。 3. **个性化AI助手的发展**:小模型更容易在本地设备上运行和适配。基于rStar,可以打造出能根据用户习惯不断学习、改进的AI助手,而不必频繁连接云端更新。 4. **教育领域的应用**:rStar的多步推理和自我验证机制,与人类学习过程天然契合。可以设计出智能辅导系统,不仅给出答案,还能引导学生一步步思考,学会自己验证。 5. **科学研究的辅助工具**:复杂的科学研究需要多角度、多步骤的深思。rStar的方法可以应用到科研辅助工具中,帮助研究者探索复杂问题、生成假设、验证理论,尤其在生物信息学、材料科学等领域潜力巨大。 6. **提升自然语言处理任务的性能**:rStar的成功不仅限于数学和逻辑推理。它在文本摘要、问答系统、语义分析等其他需要复杂推理的NLP任务上,同样有潜力让SLM的表现追上大模型。 这项研究的意义,是让我们看到了在不过分依赖庞大算力的情况下,也能实现高质量AI推理的希望。它并非完美无缺,计算效率、知识整合、任务泛化上仍有挑战,但正是这些挑战,构成了未来研究的方向。 最后,我用以上这些知识要点总结了一份SYSTEM PROMPT,试着去推演一个问题:**假设我们已经实现了通用人工智能(AGI)。在这一突破后的前五年,可能会发生哪些最显著的社会变化?**
关于宇宙的好的网名有哪些
关于宇宙的好的网名有哪些

类型:角色扮演

大小:1

语言:简体中文

平台:互联网

游戏下载

手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc