来源:互联网 更新时间:2026-08-19 14:29
对很多人来说,被“涌现”、“Scaling Law”这些名词包裹着的大模型,确实有点玄学的味道。

(图源网络)
但圈内人心里都清楚,即便在可解释性等方面还存在不少灰色地带,大模型的能力远没有外界渲染得那么神秘。
“其实没有什么涌现。”在世界人工智能大会上,复旦大学教授、上海市智能信息处理实验室副主任张奇,直言不讳。
举个具体的例子:想让模型掌握处理某项任务的能力,你得提前让它反复熟悉相关知识。这个“反复”的次数,大约在1000次上下。
“一个模型想记住一个任务,它大概需要重现1000次,这是一个经验值。”张奇说。
在那次分享中,他抛出了包括数据准备、奖励函数、场景适配在内的诸多工程经验和研究结论。在大模型仍在摸索落地最优解的当下,这些亲手“踩坑”换来的实战心得,无疑更显珍贵。
大家下午好,很高兴能在这里聊聊我们对于大模型能力边界的一些思考。
去年,我们自己动手训练了1.6B、3B、7B、100B等不同规模的模型,也实实在在做了一些落地应用。实践下来,一个很深的感受是:去年大家几乎是把大模型当成一个万能锤子,看谁都像钉子。但砸了一年才发现,在很多场景下,总是差那么一口气。
换句话说,做Demo,模型往往能拿到四五十分、六七十分;可真要落地,想突破到90分,难如登天。
这促使我们回过头来,重新审视大模型的能力边界:为什么它在某些场景下能行,在另一些场景下就不行?我们的体会是,最终还是得回归大模型的基础理论,去探讨它的能力边界到底在哪里。
语言模型的研究,已经走过了30年甚至更长的路。ChatGPT的核心,说到底还是“下一个词预测”(next token prediction)。你给它一句话,它告诉你下一个单词哪个最可能出现。
所以,不管它怎么变形,哪怕现在加上了多模态,核心思想依然没变。模型拿到内容,由Transformer来生成,然后从一堆概率里挑一个进行补全,再把结果反馈回来,如此循环往复,不断生成内容。
所以为什么叫生成式AI?道理很简单——它就是在不停产生新的单词。2020年发布的1750亿参数的GPT-3,干的也是这活儿。
从2020年到2022年,最重要的转折点发生在2022年3月,OpenAI发布了InstructGPT。还记得GPT-3那时候,模型只能补全单词,能做的事情相当有限。实际上,2021年国内也发布了不少大模型,同样只能做句子补全,很多任务只能做到二三十分。大家一直觉得模型太大,没法微调,普遍抱着“Model as a Service”的思路。
但到了2022年3月,OpenAI开始对大模型进行微调,目标不再只是补全句子,而是让所有任务都转化成生成模式。
(在对模型进行微调后,OpenAI让模型具备了完成更多任务的能力。)
比如,给模型一个问句,让它回答答案;给一道数学题,让它生成结果;给一句话,让它判断情感倾向。这时候突然发现,不需要多少数据,模型就能完成得相当好。
目前,大模型的四个主要步骤已经基本定型。
第一步,用大规模数据做预训练。这一步,到去年5月份,国内绝大部分大模型公司已经突破了。毕竟从2020年到2022年底,很多公司都在做复现工作,开源软件和数据也提供了不少支撑。
第二步,有监督微调。到今天,大部分公司已经能比较好地理解这一步了。
一直以来,我们以为有监督微调需要海量数据。对去年微软Build 2023上Andrej Karpathy给出的10万条数据结论,直到去年10月份之前,我们都还抱着相当怀疑的态度。
但现在可以明确地说,在目前较好的开源和闭源模型上进行有监督微调,覆盖几百种、上千个任务,
数据量少了,反而比OpenAI告诉我们用几亿条数据更困难。
几亿条数据本质上是个工程问题——堆数据就行了。但有监督微调只用几十万条,这就变成了一个科学问题:我们需要想清楚,为什么选这几十万条,而不是那几十万条?这背后需要大量的测试和验证。
最后一个阶段,是奖励函数和强化学习。其实,第一步做的是知识压缩和知识表示,让模型把知识记住——但这并不容易。后面有一些公式,可以让模型直接算出结果。在第二步,也就是能力的注入阶段,你需要明确想让模型完成什么任务。是阅读理解,还是翻译?必须在有监督微调阶段放入相关的少量数据。但具体怎么放,目前并没有非常好的公开论文给出答案。第三步是类人对齐,或对生成式任务的能力进行提升。
有监督微调阶段的目标其实很简单:给一句话,让模型预测下一个单词,预测得越准越好。模型越大,预测可以越准,但实现起来并不容易。
Meta今年有一篇论文,结论和我们非常接近:一个模型想记住一个任务,它大概需要重现1000次,这是一个经验值。而且,这里的“重现1000次”不是说让一本书反复出现1000遍就行,而是要用不同的语言、不同的说法让模型看到1000次。
所以大家会发现,像“中国第一高峰”这种问题,开源模型都能记得很好。但如果不做搜索增强,你问“中国第八高峰”“中国第九高峰”,基本没有模型能答对。原因很简单,这些内容的出现次数实在太少了。
这就让做行业模型变得很困难——行业数据通常不具备“高频次出现”这个条件。而且,这些数据还得用多种不同的说法多次曝光才行。
目前按照Meta这套实现结果,大致是每参数2比特的信息记录。所以,越大的模型能记住的知识越多——千亿模型能记住2000亿比特的知识,70亿模型只能记住140亿比特。
Meta做了很多参数对比,最终都稳定收敛在2比特/参数这个结果上。所以,大模型固然能力更强,但在预训练阶段,它需要大量用不同说法呈现的知识才能学进去,而且必须是高密度知识的信息。像新闻这种知识含量比较低的文本,意义就不大。
微调中的能力注入,是让模型完成任务——你想让它答题,就给它一些样例。比如你想让它回答“复旦大学有哪些校区”,那就给它复旦大学的校区信息,让它照着这个结果来答。但在这个阶段,知识其实已经注入不进去了,它只是在模仿人的答题结果。如果你想让它写作文,给它几百条数据,很多论文、作文它就都能写了。
这个量级,小到了一个相当惊人的程度。比如只是完成知识问答,其实只要两三百条数据就能覆盖全部领域。有了这个认知之后,想做领域模型也很简单:找到你想做的任务和场景。
比如在金融领域,你想做事件分析、信息抽取、阅读理解、关键数据计算等等。把这些场景归纳好,准备好相应的训练数据,就能得到一个领域模型。场景定义清楚了,数据有了,就能进行训练。但不同任务能做到什么程度,以及这些任务的数据混合在一起会产生什么问题,目前还没有非常好的研究。
阿里今年有一篇论文,在这方面做了一些探索。说实话,在有监督微调阶段,愿意发论文的公司越来越少,因为这确实是核心部分,都是花了大价钱测试出来的。阿里这篇论文告诉了我们几件事:
第一,模型的参数量对任务有一定影响。比如7B、13B、33B在不同任务之间存在差异,但7B和13B的差距其实没那么大。33B在一些任务上则会有明显提升。
第二,任务的训练数据量很关键。如果只用非常少的训练数据,效果不会好。但数据量也得有个上限,在某个范围内才合适。所以数据量级的选择就成了关键,而且任务之间的混合也会带来不同的问题。
总结一下有监督微调阶段的一些结论:
在奖励函数和强化学习这个阶段,通常被大家称为“类人对齐”。但看下来,它更多是对生成式任务的提升。
比如我们在安全伦理上做了对齐:问“考试作弊设备哪里去买?”如果只用指令微调的数据训练完,模型最后会补一句“你要去正规渠道买”。这是因为模型见过大量开放域的数据,买东西的语境后面很多都会补上这句“在正规渠道”。
想把这个部分纠正过来,就得靠强化学习——利用强化学习技术,把生成式的方式转变得更加类人。
所以强化学习在整个大模型训练中起到了非常重要的作用。说起来简单,做起来难度挺大。
首先,要标注哪个结果更好。模型输出两个结果,让人打标签,看A好还是B好。
但这件事不容易。如果只是打“A和B哪个好”这个直接结论,不一致性会很高。真正做的时候,其实是让人写一段小作文,讲述A为什么好、好在哪里,B为什么不好、不好在哪里。一条这样的数据标注,大概要花一个小时的人工。如果是法律模型,要找律师;儿科问题要找儿科医生;中考作文要找中学老师——都是很专业的事情。
整体看下来,强化学习阶段的成本非常高——一条标注就是一个小时。有了标注还没完,后面的部分更复杂,比有监督微调的整体逻辑要复杂很多。
这说明,模型仍然需要逐项优化。这和去年大家普遍的想法有些出入——当时很多人觉得,只要模型参数量足够大,它就自然具备了涌现能力,什么事情模型自己就都会了。
但事实并非如此。我们需要逐项优化,而逐项优化的成本很高。另一面,用大模型做演示非常容易,拿到60分很容易,但想达到90分、想真正落地,每一个任务都非常困难。
调整模式就像刚才介绍的:训练数据量的增大,并不一定会让结果变好。有可能到了几千条之后,模型效果反而开始下降。而且数据量增大后,这些数据已经变了。
效果无效之后,会使模型变得非常难调。你只能在控制训练数据量的情况下——比如只有几千条时——想办法让结果升到90分。
这其实是一个很困难的事情,比之前小模型难多了。小模型大不了加大数据量,十万不够加到100万,模型结果升得慢,但它最终会上涨。大模型不一定,效果不涨反跌,而且可能掉得很快。
第三,大模型本质上是概率模型。让模型记住知识,不可避免地会带来幻觉和错误。这个问题在我看来是不可避免的。现在OpenAI也基本放开了Search,不再强调直接用模型进行事实型回答。
最后,想谈谈模型未来的发展。目前看就是两条路。
第一条路,AGI代替所有脑力劳动。如果你认可Scaling Law,觉得压缩就是智能,觉得只要记住知识就具备了智能,那就去做万卡集群、十万亿模型、100TB甚至几百TB的训练数据。
但这条路也有很多难题。首先,现在的模型推理能力比较弱,缺乏归纳推理的能力。体现在数学上,去年的高考题不会做,初中题也不会做。
怎么让大模型具备真正的推理能力,以及对世界知识的建模能力?这些都是模型阶段需要解决的问题。大模型的资本消耗也是巨大的——万卡集群一旦跑起来,每天的消耗量都相当惊人。
从后续分析来看,前段时间发布的GPT-4o和GPT-4在能力上基本没有区别,尤其是推理能力没什么变化。区别主要在产品层面——把模态合并了,有了更好的表现。
所以猜测一下,GPT-5可能会在文本、图像、视频、音频的理解上进行合并。现在GPT-4o已经合并了,但还少了一个视频生成。最终在GPT-5上,可能会把视频生成也合并进来,再加上一些非常好的产品力——比如GPT-4o里面300毫秒的低延迟,这种很棒的产品体验。
真正在做AGI核心研究的,是Ilya他们搞的“超级对齐”。过去的方法,是用教师教学生——人标数据,再交给机器学。但这样学出来的结果,学生永远低于老师。想让模型具备更强的AGI能力,它需要从一个相对弱的智能体,通过与环境的交互获得反馈,自己成长为强智能体。
这个方案在逻辑上说得通,但真正实现起来很难。Ilya在走之前发了一篇论文,结果并不正面——可能在有些领域有点提升,但距离目标还很远。
另一方面,在不同任务之间,这种方式用了很多不同的技巧,结果导致模型并不具备它设想的能力,反而占用了OpenAI 20%的资源。以OpenAI的人力资源和计算资源来说,20%已经是一个相当大的体量了。只能说,这是一条路,但需要海量的投入,而且多久能走通,也是个未知数。
另一条路,是做应用,也就是做特定任务。这条路的基本假设是:我们不期待AI取代大部分脑力工作,只取代一部分就好。在每个行业,80%的工作量其实都非常集中。所以我们可以选择相应的参数量,准备训练数据和计算资源。
这种方式下,GPU的规模可以大幅度下降。但这里的基本假设是——我不相信AGI。如果AGI实现了,这条路做的工作就是无用功。但如果AGI实现不了,在特定领域做得非常好,同样具备很大价值。
选择的难点其实在于对模型能力边界的判定——模型到底能不能做推理?这是一个巨大的争议。即便在我们实验室里也是两派,有人认为能做,有人认为不能。到底能不能,需要大家自己做判断。
场景的选择,既要符合模型能力,又要具备商业价值。模型在能力上能做很多事,但很多场景并不具备商业价值。德勤研究院给了一张挺不错的图。
换句话说,
画图也是类似的逻辑。但是,给普通用户起草合同是不是好场景?如果用户不具备法律常识,当然可以替代很多工作量。但用户不具备法律常识,根本不知道合同里写得对不对,还得逐条去验证——这时候验证难度就非常高。这样的场景,其实并不适合AI落地。
那是不是给专业律师起草就一定好?这个场景验证难度降低了,但律师其实很多时候只处理特定类型的案件,有很多现成模板。所以能不能真正降低他的工作量?不一定。这个场景就落在“待评估”的区域。
所以,在AI产品选择上,除了资金投入,另外两个维度——结果可以被轻易验证、任务工作量大——可能都需要仔细考量。当这三个条件合在一起,就没剩下多少产品了,落地就变得非常困难。尤其对于创业型公司来说,难度会急剧上升,三个条件缺一不可。
话说回来,围绕着大模型已经确认的核心能力——长文本、跨语言、多任务、精准的语义表示——将模型能力与产品、场景相结合,还是能够产生非常大的价值。
腾讯ima怎么把微信内容一键导入知识库?
黄金价格不断创新高!黄金稳定币XAU、PAXG市值达11亿美元
CC币价格预测(2026-2035):Canton币今日价格走势+长期价格预测
新浪互联网热点小时报丨2026年07月26日16时_今日实时互联网热点速递
2026鸣潮账号交易安全指南:五大交易平台对比与风险避坑分析
腾讯ima怎么创建共享知识库?
今日比特币暴涨分析:Metaplanet的比特币BTC投资推动股价上涨17%
新浪机器学习热点小时报丨2026年07月25日18时_今日实时机器学习热点速递
新浪人工智能热点小时报丨2026年07月30日18时_今日实时人工智能热点速递
蚂蚁庄园今日答案7月21日(今日已更新) 蚂蚁庄园今天正确答案是什么呢
比特币(BTC)核心周期指标复刻历史走势 价格或跌破5.8万美元关键支撑位
Celestia价格预测2026-2032:TIA币能否引领山寨币上涨行情?历史价格回顾
2026年三角洲行动账号交易指南:5大交易平台对比与安全选购建议
车载冰箱重置到出厂设置几步?
抖音怎么取消申请退货退款?抖音上取消退货怎么操作
腾讯ima知识库怎么分类管理?
短剧《史上最强洪荒修为》剧情介绍
WorkBuddy微信版怎么获得积分?
Windy卫星云图怎么看?云层变化识别技巧
TRUMP价格走势与WEPE预售进展解析
手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc