热门搜索:和平精英 原神 街篮2 

您的位置:首页 > > 教程攻略 > ai资讯 >200美元的ChatGPT Pro正式上线,聪明N倍的新模型草莓要来了。

200美元的ChatGPT Pro正式上线,聪明N倍的新模型草莓要来了。

来源:互联网 更新时间:2026-08-27 14:27

半夜时分,The Information一则消息透露,OpenAI的新模型“草莓”即将面世。紧接着,有消息称ChatGPT Pro会员已悄然上线,售价200美元/月。有用户第一时间付了款,甚至刚付完还没开始用,这个尊贵的Pro账号就被借来一探究竟。结果一看,自己的账号里啥也没有——这效率,属实让人哭笑不得。

现在,ChatGPT的会员体系被分成了三档:

Plus、Team、Pro

。这个分法颇有库克式的产品分层味道,让人不禁猜想:后面会不会还有ChatGPT Pro Max?但遗憾的是,目前Pro会员并没有带来新功能或新模型,唯一区别是GPT-4o的使用次数接近无限——短时间内测试了几百条,依旧畅通无阻。反观Plus会员,GPT-4o的额度是每3小时80条。

一个无限制的使用权限,自然配不上从20美元/月跳到200美元/月的十倍涨价。若OpenAI真这么干,那基本等于奥特曼被马斯克夺舍了。结合The Information的新闻,可以基本确认:

这个ChatGPT Pro会员,是过段时间为全新模型“草莓”(Strawberry)准备的

。想用上草莓?先开个200美元的Pro会员再说。

草莓到底是什么?

目前没有确切的结论,但根据所了解的信息梳理,它可能是:

基于新范式Self-play RL打造,在数学和代码能力上强到爆炸,且具备自主为用户执行浏览器或系统操作级别能力的新模型。


更智能、更慢、更贵。

用最简单朴素的语言来解释:凭什么卖200美元/月?

首先得谈一下GPT-5的问题。GPT-5的训练并不顺利。一个明显的信号是,以数据规模和模型规模为美的“大力出奇迹”路线,边际收益开始递减,那种百试百灵的魔力似乎已经黯淡了。

大语言模型的Scaling Law描述了模型性能L、训练数据大小D和计算量C之间的关系。

随着计算量、模型参数和数据集规模的增加,性能通常显著提升。但如今,这三者都遭遇了瓶颈——尤其是闭源模型,进步速度相比过去齐刷刷放缓,而开源模型的能力差距正逐步缩小。

也就是说,再靠“大力出奇迹”,模型能力已经快上不去了。本质上,所有大模型的训练几乎都建立在人类已有知识之上:我们提供数据、人类反馈或标注数据,模型从中提取有用信息,却很少通过自我探索去“发现”语言规律。

这就像一个学生,通过不断背书确实能提高成绩,但到了一定程度后,没有可背的内容,成绩也触达上限,死记硬背很难再带来突破。

如今的困境有两层:一是现有知识的量级已经不够;二是所有知识都是现成的,缺乏从零开始的探索。大模型在这个过程中,

学到的是相关性,而非因果性

。解释起来很简单:

相关性

——每次带伞都下雨,伞和下雨看似相关,但带伞不会导致下雨。

因果性

——下雨了才带伞,这是因为下雨导致了带伞的行为。所以,当你让大模型做复杂推理、写清推理过程时,它中途的逻辑经常乱七八糟,错得离谱。它就像一个百科全书式的学霸,知道很多事实,却未必理解背后的原理和真正因果。你若问一个只会死记硬背的学生:“为什么苹果会落到地上?”他会回答:“因为有重力。”再追问“重力是什么?为什么会有重力?”他可能就哑口无言了。大模型也一样:它知道地球是圆的,却无法真正解释原因或影响,它只学到“地球”和“圆”这两个词常一起出现,具有强相关性,而非理解因果。

相关性告诉你两件事总是一起发生,因果性则告诉你为什么它们会一起发生。

这也是为什么,我们需要新范式来破局。而这个解法,是目前观察下来OpenAI、Google、Anthropic、Ilya等人达成的共识:

Self-play RL

全称是自我对弈强化学习。用个简单的比喻:

一个孩子学习下围棋

。现在大模型的学习方式,是看棋谱、记开局、背固定战术——它知道很多解法,却不真正理解为什么这么下。而Self-play RL,则让这个孩子不停地和自己对弈。刚开始可能下得很差,但通过不断尝试不同走法、观察每步结果,他会慢慢发现哪些策略有效、哪些会输。这个过程中,孩子不仅仅在记忆棋谱,而是在真正理解棋局的变化和每一步的因果逻辑。

这就是从相关性到因果性的飞跃。

这个描述很熟悉?没错,这就是2017年名动天下的

AlphaGo Zero

当年,AlphaGo在乌镇以3:0击碎柯洁道心,轰动世界。而AlphaGo Zero是它的进阶版。官方描述如是说:“刚开始时,AlphaGo Zero很菜,还会填真眼自杀。3小时后,它成功入门围棋。36小时后,它摸索出所有重要知识,以100:0碾压击败李世石的AlphaGo v18。21天后,它达到Master水平——年初60连胜横扫围棋界的版本。40天后,它对战Master胜率达90%,成为寂寞无敌的最强围棋AI。”这就是Self-play RL的恐怖威力。

Self-play RL让AI不断和自己“对弈”——可能是下棋、解决数学问题,甚至进行对话。过程中,AI不是重复看到的内容,而是主动探索、尝试和学习。

大模型是把“死记硬背”发挥到极致,而Self-play RL则是把“自我成长”发挥到极致。

数据还是那个数据,只不过一个是人给的,一个是自己造的。用人给的东西死记硬背,永远成不了超越人类的超级AI;自己造数据学习,才有无限可能。围棋、Dota2等领域已证实这一点。而大模型+Self-play RL,就是让模型自己和自己博弈,得到反馈后优化权重,调整水平,然后继续战斗。

得益于大模型自身能力,在自我博弈中,不只能给出最终结果反馈(这对提升推理能力有限)。不同于围棋、Dota2这种特定任务,大模型能力泛化性极强,我们需要更多因果关系,而不仅仅是结果。于是,大模型可以引入“思维链”,把推理过程中每一步的思考都记录下来,对每一步进行评分,让模型知道每个步骤的好坏。这样,模型不仅学会给出正确答案,还能改进整个推理过程,理解真正的因果。甚至,不止打分——借助大模型的能力,还可以进行文字评语。这就像做作业时,老师不仅打分,还写下评语告诉你哪里做得好、哪里需要改进,肯定比只知道一个得分结果强大得多。

而且每一次学习,都是从推理过程中获取宝贵的反馈。

当模型回答复杂问题时,会进行类似Self-play的过程:生成多个可能思路,评估其质量,选择最佳的一个。有文章曾计算过,一个百亿参数的大模型,用Self-play方式生产思路,若每次生产32个思路,每个思路包含5个步骤,

一次推理回答的总任务消耗达100K token,将近6美元。

又贵、又慢,但真的智能。最好的数据会被保存下来,以固定周期迭代模型,持续进化。这也是为什么,在草莓的曝光描述中,提到:

“Strawberry与其他模型的最大区别在于,它能够在响应之前‘思考’,而不是立即回答查询,这个思考阶段通常持续10到20秒。”

回看文章开头的ChatGPT Pro会员,200美元/月——推理成本太高了!这就是典型的,在“大力出奇迹”边际效应递减的情况下,用推理成本换取训练成本,继续推动模型迭代。也是为什么OpenAI一直说,

草莓是给下一代大模型合成数据用的,因为它是Self-play RL的载体

所以,回头再看,草莓可能是什么?

是基于新范式Self-play RL所做的,在数学和代码能力上强到爆炸、且具备自主为用户执行浏览器/系统操作级别能力的新模型。


更智能、更慢、更贵。

最后一个问题:为什么草莓的数学和代码能力会强到爆炸?答案很简单——数学和代码非常容易验证。在Self-play里,它们能给出明确结果:数学不言自明,代码能不能跑起来可验证。所以,这两项一定最先一飞冲天。Claude 3.5的代码能力之所以如此强大,就是用Self-play RL做的。

想起前几天,跟一位做AI应用的专业朋友聊天。他刚从海外回来,见了一些科研人员。有内部研究员如此形容Self-play RL:

“通往AGI的路上,已经没有任何阻碍。”

在沉寂近一年后,我们可能要迎来一个全新的大模型技术爆发周期了。值得拭目以待。

关于宇宙的好的网名有哪些
关于宇宙的好的网名有哪些

类型:角色扮演

大小:1

语言:简体中文

平台:互联网

游戏下载

热门手游

手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc