热门搜索:和平精英 原神 街篮2 

您的位置:首页 > > 教程攻略 > ai资讯 >OpenAI全新发布o1模型 - 我们正式迈入了下一个时代。

OpenAI全新发布o1模型 - 我们正式迈入了下一个时代。

来源:互联网 更新时间:2026-08-27 14:24

大半夜的,OpenAI憋了快半年的新模型,在没有任何预告的情况下,突然就登场了。正式名称不叫草莓——草莓只是内部代号——它叫

OpenAI o1

。为什么叫o1?OpenAI是这么说的:

“对于复杂推理任务来说,这是一个重大进展,代表了AI能力的新水平。因此,我们把计数器重置为1,并将这个系列命名为OpenAI o1。”

翻译过来就是:这次模型的强悍程度,让OpenAI不惜推翻了过去GPT系列的命名体系,重新起了一个o系列。炸了,真的炸了。

说实话,看完发布信息,我也头皮发麻。这次发布,标志着一个全新纪元的开始——

“我们通往AGI的路上,已经没有任何阻碍。”

先看数据,直接上图——你就能知道这玩意儿有多离谱。AIME 2024,一个高水平的数学竞赛,GPT-4o准确率13.4%,o1预览版56.7%,而尚未发布的正式版达到了83.3%。代码竞赛方面,GPT-4o准确率11.0%,o1预览版62%,正式版89%。最恐怖的还是博士级科学问题(GPQA Diamond):GPT-4o只有56.1,人类专家水平是69.7,而o1直接飙到了78。借用Claude翻译了一下o1的数据图,虽然丑了点,但每项数据的含义一目了然。什么叫全面碾压?这就是。尤其是在测试化学、物理和生物学专业知识的基准GPQA-diamond上,o1的表现全面超越了人类博士专家——这也是有史以来第一个获得此成就的模型。

基石:Self-play RL与慢思考

整个模型之所以达到这个成就,基石就是Self-play RL。通过Self-play RL,o1学会了打磨自己的思维链,完善所采用的策略:它学会了识别并纠正自己的错误,学会了把复杂的步骤分解成更简单的步骤,而且当当前方法不起作用时,它还会尝试不同的路径。它学会的这些,正是人类最核心的思考方式——

慢思考

诺贝尔经济学奖得主丹尼尔·卡尼曼的著作《思考,快与慢》,详尽阐述了人类的两种思维模式:

  • 快思考(系统1)

    :快速、自动、直觉、无意识。比如看到笑脸就知道对方心情好,1+1=2这样的简单计算,开车遇到危险立即踩刹车。这就是传统大模型学到的快速反应能力。
  • 慢思考(系统2)

    :缓慢、需要努力、逻辑、有意识。比如解决一道复杂数学题,填写税务申报表,权衡利弊后做重要决定。这正是人类之所以强大、AI向AGI迈进的核心基石。

现在,o1终于迈出了坚实的一步——拥有了人类慢思考的特质,在回答问题前会反复思考、拆解、理解、推理,然后给出最终答案。这种增强的推理能力在处理科学、编码、数学及类似领域的复杂问题时,绝对极度有用。例如,医疗研究人员可以用它来注释细胞测序数据,物理学家用来生成量子光学所需的复杂数学公式,开发人员用来构建和执行多步骤工作流,等等。

数据飞轮与进化速度

o1也绝对是全新一代的数据飞轮。

如果答案正确,整个逻辑链就会变成一个包含正负奖励的训练示例的小型数据集。以OpenAI的用户级别,未来的进化速度只会更恐怖。

写到这儿,不禁叹了口气:感觉跟一年以后的o1比起来,自己可能就是个纯废物了……

开放情况与使用体验

目前,o1模型已逐步向所有ChatGPT Plus和Team用户开放,未来会考虑对免费用户开放。分为两个模型:o1预览版和o1-mini。o1-mini更快、更小、更便宜,推理能力不错,极度适合数学和代码,但世界知识会差很多——适用于需要推理但不需要广泛世界知识的场景。使用限制:

o1预览版每周30条,o1-mini每周50条。

雪崩!甚至不是按以前3小时来限制的,是每周30条——侧面也能看出o1这个模型有多贵。对开发者来说,只对已付过1000美元的等级5开发者开放,每分钟限制20次,都挺少的。功能上有不少阉割,但毕竟早期,可以理解。

API价格方面:o1预览版每百万输入15美元,每百万输出60美元——输出成本是输入的4倍。o1-mini便宜些,每百万输入3美元,每百万输出12美元。对比一下GPT-4o,分别是5美元和15美元。o1-mini勉强有一些经济效应,不过还是开始,后面等着OpenAI打骨折吧。

既然说o1已经对Plus用户开放,直接去账号上看了一眼,不错,拿到了。

那自然第一时间试一试。目前不支持曾经的所有功能——没有图片理解、图片生成、代码解释器、网页搜索等,只有一个可以对话的裸模型。

先来一个曾经很致命的问题:

“农夫需要把狼、羊和白菜都带过河,但每次只能带一样物品,而且狼和羊不能单独相处,羊和白菜也不能单独相处,问农夫该如何过河。”

思考了6秒,给了个很完美的回答。

还有之前坑遍所有大模型的调休问题:

“这是中国2024年9月9日(星期一)开始到10月13日的放假调休安排:上6休3上3休2上5休1上2休7再上5休1。请你告诉我除了我本来该休的周末,我因为放假多休息了几天?”

o1思考了整整30秒后,给出了一天不差的极度精准的答案。

无敌,真的无敌。

再来个更难的——曾经姜萍那个比赛的奥数题。别问我题目什么意思,我看不懂,这题曾经屠杀所有大模型。这次让o1也来试一下。o1思考了1分多钟后,给出了答案……全对。直接裂开。

目前个人试下来,感觉Prompt未来可能也要重新摸索。在GPT为代表的快思考大模型时代,我们有很多所谓“一步一步思考”之类的提示词,现在全部无效了,对o1甚至还有负效果。OpenAI给出的最佳写法是:

  • 保持提示简单直接

    :模型擅长理解和响应简短、清晰的指令,不需要大量指导。
  • 避免思路链提示

    :由于模型内部已经进行推理,不需要提示它们“逐步思考”或“解释你的推理”。
  • 使用分隔符提高清晰度

    :使用三重引号、XML标签或章节标题等分隔符,清楚指示输入的不同部分。
  • 限制检索增强生成(RAG)中的附加上下文

    :提供附加文档时,只包含最相关的信息,防止模型过度复杂化响应。

关于思考时长与未来

最后说下思考时长。现在o1思考一分钟,但如果是真正的AGI,思考得越慢可能越刺激。当它真的可以去证明数学定理、做癌症药物研发、做天体研究时,每一次思考可以耗费几小时、几天甚至几周。最终的结果,可能会让所有人震惊到难以置信。

现在,没有人能想象到那时候的AI会是一个什么样的存在。而o1的未来,绝对不止是一个普普通通的ChatGPT——它是我们前往下一个时代最伟大的基石。

“我们通往AGI的路上,已经没有任何阻碍。”

现在,这句话让人毫不犹豫地坚信。星光熠熠的下一个时代,在今天,正式到来了。

关于宇宙的好的网名有哪些
关于宇宙的好的网名有哪些

类型:角色扮演

大小:1

语言:简体中文

平台:互联网

游戏下载

热门手游

手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc