来源:互联网 更新时间:2026-07-31 13:55
今年以来,高级大模型市场正在上演一场“神仙打架”的好戏。Claude 3 Opus、Gemini Pro 1.5、GPT-4 Turbo 轮番在各类Leaderboard上登顶,上演着“城头变幻大王旗”的戏码;另一边,Meta将在未来数周内发布Llama 3,OpenAI则计划在“不久的将来”放出GPT-5。好不热闹。

在multimodal风头无两的同时,高级大模型比拼的主战场正在悄然回归——解决更复杂的问题。比如GPT-4 Turbo的最新版本,就重点强调了在Math、Logical Reasoning和Coding方面的提升;而OpenAI和Meta AI的高管也多次表态,System-2级别的推理能力是下一代大模型的核心竞争力。
细数下来,语言大模型的推理能力提升主要有三条路径(图1):
图1: 外家功夫 vs 内功心法 vs 内丹修炼
目前,绝大多数大模型厂商已经将第一条路径让给了生态体系,而第二条路径当下又缺乏泛化性。所以,有着Mixture-of-Experts(MoE)成功经验的“内丹修炼”,自然成了硅谷当下的“显学”。今天就分享一些有趣的“炼丹”思路和论文。
Transformer在System-2的实现之路上有着不少障碍。Andrej Karpathy曾诟病大模型缺乏“Slower Thinking”的能力,而Yann LeCun则认为LLMs不能“Think before Talk”。如果站在宏观视角看,会发现这些障碍的一个主因是:Transformer过于“平等”地对待每一个Token。
在经典Transformer中,每一个Token的生成都要经历相同规模的Blocks/Layers,耗费相同的时间(MoE会选择不同Expert,但计算规模和时间耗费没有变化)。简单问题和复杂问题,在大模型这里一视同仁,不会因为问题复杂就多算一次点积。
而当下“炼丹”的主要思路之一就是打破这种“平等”,包含两个主要方向(图2):
图2: 炼丹的主要思路,Graph inspired by YT "All About AI"
Google DeepMind最近提出的Mixture-of-Depths(MoD)就是“分而治之”的探索实践。MoD的主要思路是:通过前置Router,实现对每个Token的动态计算资源分配,降低总体FLOP规模并保证生成准确性。
MoD的每个Layer都由两条线路构成(图3):左边是速通路线,Token不参与任何计算;右边是经典路线,Token参与包括Self-Attention和MLP的所有计算。MoD的具体工作方式如下:
图3 MoD的机制[1]
这个Router由Neural Network实现,并通过参与Gradient Descent Optimization与MoD共同训练而成。
MoD的测评结果相当亮眼:因为有相当数量的Token不参与计算,MoD能够
很多人抱怨大模型“胡说八道”。但事实上,Transformer并非不知道正确答案,只是做出了错误的选择。
DeepMind的另一篇论文《Chain-of-Thought Reasoning Without Prompting》就印证了上述观点。论文发现,当Transformer生成答案的第一个Token时,正确答案有可能不在Logits中最优候选(top-1)所代表的路径上,而是出现在其他次优候选(top-k)的路径中。比如在下图中,top-2/4,而非top-1,代表正确答案(图4),而且次优候选路径提供的答案质量堪比CoT:
图4: 正确答案往往会出现在次优候选路径[2]
但经典Transformer并不具备探索多个次优候选路径并评估其正确性的能力,只是随机从top-k中抽取一个概率较高的候选展开回答。这个机制导致大模型即使在知道正确答案的情况下,也不能正确作答。
这个发现让硅谷的科学家们开始试图给Transformer“插上思考的翅膀”。Stanford最近发布的论文《Quiet-STaR》就代表了这种“插上翅膀”的实践。论文的思路是:
Transformer结合最优候选路径和n条次优候选路径中的优质回答
Quiet-STaR的训练过程包含三步:
图5: Quiet-STaR的训练机制[3]
需要注意的是,Talk过程中的Mix Logits决定了最优和次优候选路径在预测中各自所占的比例。当最优候选路径已经能达到相当准确度时,次优候选路径就不会参与生成,以降低计算成本。此外,在Inference过程中,Quiet-STaR只推演最好的次优候选路径以提升效率。
即使没有进行Fine-tuning,Quiet-STaR也能在CommonsenseQA(36.3%→47.2%)和GSM8K(5.9%→10.9%)等任务上提升Zero-shot的推理能力,而且这些提升随着“Think”所使用的Thoughts包含Token数量的增加而增强(图6)。
图6: Quiet-STaR的测评结果[3]
Quiet-STaR的实现与采用MCTS的Alpha Go有异曲同工之妙。强化学习的引入让Transformer可以先思考(Think),然后在多个方案中择优以生成下一个Token(Talk)。
Google DeepMind和Stanford的这两篇论文,代表了行业顶尖团队的“炼丹”思路。建议阅读论文原文,也许在不久的将来,就能在商业或开源大模型中看到基于上述论文的落地实践。
摩托车活塞环性能如何
ThinkBook系列最新价格全解析:2026年选购避坑与实时询价指南
Ondo将于今日上线股票永续合约
暗黑4S14野蛮人终局BD攻略
区块链OTC交易所有哪几家比较正规?
Binance新增15种bStocks代币化证券为杠杆抵押资产
货拉拉如何查看历史订单 货拉拉往期行程轨迹查询【功能教学】
Meme币DOGS今晚上线!开局就解锁91%代币是否带来风险?
晶核艾尔莎角色盘点 晶核艾尔莎强度分析与实战表现
剑侠世界3雪峰论剑怎么打-剑侠世界3雪峰论剑打法介绍
五千元以下的笔记本几乎消失!经销商:至少一年看不到涨价尽头
Intel喜讯连连:18A工艺良率提升到85%、CPU将涨价15%
今日小鸡庄园答案2026.7.2
美债股纳斯达克首盘暴跌38%且加密代理交易解体,AVAX价格何去何从?
男生头像配网名可爱(精选100个)
赵云与阿斗神兵符使用教程 神兵符怎么使用
国家养老服务消费补贴上线京东
余姚的路虎4s店在哪个位置
英伟达机器人团队在京沪深招人,聚焦具身智能等四大领域
一站式PDF转Markdown解决方案PDF3MD
手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc