来源:互联网 更新时间:2026-08-27 14:44
Source: OpenAI o1 Results on ARC-AGI-Pub (arcprize.org)

过去24小时里,我们拿到了OpenAI最新发布的o1-preview和o1-mini的使用权限。这两款模型主打“模拟推理”,也就是说,在给出最终答案之前,它们会多花些时间,生成并打磨一下自己的推理步骤。
很多朋友问,这o1在ARC Prize上拿了个什么水平?我们用和评估Claude 3.5 Sonnet、GPT-4o、Gemini 1.5完全一样的基准框架,把它跑了一遍。结果如下:
那么,一个关键的问题就来了:o1到底是不是通往通用人工智能(AGI)的新范式?它的能力能否通过堆算力继续扩展?为什么o1在IOI、AIME这些高难度测试上杀疯了,可在ARC-AGI上却只拿了个中等成绩?这中间的差距,值得好好拆解一下。
o1这次在训练和推理两阶段,都彻底玩起了“一步一步推理”——这个我们叫链式思考(CoT)的东西。
实际跑下来发现,当任务中的中间推理步骤,已经大量出现在合成CoT训练数据里时,o1出错的概率明显降低。训练阶段,OpenAI表示他们搞了一套新的强化学习算法,配上高效的数据处理流程,核心就是利用CoT。换句话说,o1的底子还是那堆固定的预训练数据,但OpenAI能靠生成大量模拟人类推理的合成CoT,再用强化学习继续训练模型。
不过有个谜团:OpenAI怎么选择这些用于训练的合成CoT?虽然细节不多,但推测一下,强化学习的奖励信号可能来自两个方向:数学和代码这类正式领域靠验证器,任务分解和规划这种非正式领域靠人工标注。推理阶段,OpenAI说他们用强化学习让o1可以优化自己的CoT、调整策略。推测这里的奖励信号,可能跟之前开源的actor-critic系统类似。同时,他们在推理时还对生成的推理标记用了搜索或回溯技术。
o1最亮眼的地方在哪里?它成功地把CoT推理搜索这种玩法,搬到了非正式语言(比如日常对话)的战场上,而不是只局限在数学、代码、Lean这类形式化的领域。
训练阶段用CoT来扩展当然值得鼓掌,但真正的亮点是测试阶段的扩展能力。可以确定的是,通过迭代CoT,模型确实有可能实现更广泛的泛化。自动迭代重提示,能让模型像MindsAI团队用的测试时微调那样,更好地应对新场景。如果只做一次推理,那模型就很难跳出记忆的老路。但每遇到一个新任务,都生成中间输出的CoT,就有机会把学到的各种程序组件组合起来,实现真正的适应性。
这种方法,其实是在解决大语言模型泛化的头号难题——适应新情境,虽然和测试时微调一样,最终还是会有天花板。
当AI系统被允许在测试阶段使用不同量的算力(比如推理标记的数量或搜索时间)时,你不能只用“一个分数”来概括它的表现,因为结果完全取决于你给了它多少算力。这正是下面那张图展示的道理:算力越强,准确性越高。
OpenAI发布o1时,本来可以让开发者指定在测试阶段花多少算力去优化CoT。但他们没这么干,而是“硬编码”了一个固定的测试算力水平,并且把这个细节藏了起来。这意味着,在测试算力可变的情况下,不能再简单地拿两个不同AI系统的输出对比,来衡量谁更聪明——你还得比较它们的计算效率。
OpenAI的公告里没提效率数据,但让人兴奋的是,我们正在进入一个以“效率”为核心的时代。效率对于定义AGI至关重要,这也是ARC Prize对获奖方案搞效率限制的原因。可以预判的是:接下来,我们会看到越来越多以“准确性 vs. 测试阶段算力”为轴的基准测试图表。
在ARC-AGI公开评估数据集上,OpenAI的o1-preview和o1-mini都超过了GPT-4o。其中,o1-preview在准确性上和Anthropic的Claude 3.5 Sonnet大致相当,但达到相似结果花的时间,是Sonnet的10倍左右。
为了拿到ARC-AGI-Pub排行榜上的基准分数,我们沿用了测试GPT-4o时所用的基准提示。测试像o1这种纯模型时,目的就是尽量测出基础模型本身的性能,不叠加任何优化层。未来,如果有人找到了更好的提示CoT风格模型的方法,验证之后,我们也欢迎把它加到排行榜里。
当然,性能的提升是有代价的。处理400项公开任务,o1用了70个小时,而GPT-4o和Claude 3.5 Sonnet只用了30分钟。值得注意的是,排行榜上那些顶尖的提交,不仅仅是前沿模型的功劳,背后还融入了不少巧妙的技巧。
OpenAI那张图展示的是AIME上准确性与测试时间算力之间的对数线性关系——算力每指数级增长,准确性就线性上升。这就引出一个新问题:这种扩展,到底能走多远?
这个概念唯一的限制在于:你问的问题本身是否可判定。只要搜索过程有一个包含答案的外部验证器,你就会看到准确性随算力增加而对数增长。实际上,这个结果和Ryan Greenblatt在ARC Prize里的顶尖方法之一极为相似。他让GPT-4o为每个任务生成了k=2,048个解决方案程序,然后根据任务演示进行确定性验证,拿到了43%的分数。接着,他又测了不同k值下的准确性变化。
Ryan在ARC-AGI上也发现了同样的准确性与测试算力的对数线性关系。
那么,是不是说只要扩展测试算力,AGI就算来了?远非如此。只要观察一下任何O(x^n)的暴力搜索,都能看到类似的指数增长曲线。实际上,我们知道至少50%的ARC-AGI问题可以用暴力搜索解决,而不是靠AI。但用这种方式击败ARC-AGI根本不现实——你需要为每个任务生成超过1亿个解决方案程序。从实用角度看,O(x^n)搜索对于扩展后的AI系统来说,就已经出局了。
何况,人类不是这么解决问题的。人类不会生成成千上万个备选方案,而是靠大脑中的感知网络来“看见”少数几个潜在解法,再用系统2型思维去确定性验证。我们完全可以做得更聪明。
衡量智能的标准,是系统在不同情境下,将信息转化为行动的效率。这本质上是个转化率问题,因此存在上限。当智能达到完美时,唯一的进步途径就是收集新信息。
有些方法能让不那么智能的系统看起来更聪明,实际上却没有真正提升智能水平。一种是让系统只记忆最佳行动——这种系统非常脆弱,在某一领域可能表现不错,但换个领域就迅速崩盘。另一种是靠试错,系统最终得出正确答案,可能会让人觉得聪明,但如果花了上百次猜测,那显然不是真正的智能。
期待未来的测试算力研究,能更高效地扩展搜索和精炼过程,比如借助深度学习来引导搜索。但仅凭这些,还不足以解释o1在ARC-AGI和其他高难度基准测试(比如IOI或AIME)之间的巨大性能差距。
更合理的解释是:o1很大程度上还是运行在预训练数据的分布范围内,只不过现在多了大量新生成的合成CoT。这些额外的合成CoT数据,让系统更关注推理过程的分布,而不仅仅是答案的分布——换句话说,更多算力花在了“怎么得出答案”上,而不是“答案是什么”。
可以预判,像o1这样的系统,在涉及重用已知模拟推理模板(程序)的基准测试上会表现很好,但在需要即时合成全新推理的问题上,还是会有短板。测试阶段对CoT的精炼,只能在一定程度上纠正推理错误。这也就解释了,为什么o1在某些领域特别出色——当基础模型本身就用类似方式预训练时,测试阶段的CoT精炼会得到额外的助力。
单一方法,无法实现质的飞跃。总的来说,o1代表了从“记忆答案”到“记忆推理”的范式转变,但它并没有跳出通过拟合分布曲线来提升性能的广义范式。要真正迈向AGI,我们还需要全新的思路。
腾讯ima怎么把微信内容一键导入知识库?
腾讯ima怎么创建共享知识库?
Celestia价格预测2026-2032:TIA币能否引领山寨币上涨行情?历史价格回顾
比特币(BTC)核心周期指标复刻历史走势 价格或跌破5.8万美元关键支撑位
比特币 2025 年价格预测:BTC 的未来走势
新浪互联网热点小时报丨2026年07月26日16时_今日实时互联网热点速递
WorkBuddy微信版怎么获得积分?
5000元起的鼠标哪个最值得入手?
新浪人工智能热点小时报丨2026年07月30日18时_今日实时人工智能热点速递
腾讯ima知识库怎么分类管理?
短剧《史上最强洪荒修为》剧情介绍
海尔消毒柜自动消毒如何中止
博世壁挂炉关闭暖气怎么操作
男生高性价比充电头?
车载冰箱重置到出厂设置几步?
SPX6900(SPX)币是什么?SPX币价格走势分析及未来展望
管线机怎么接云米净水器
Windy卫星云图怎么看?云层变化识别技巧
WorkBuddy积分怎么获得?
kimi提示词专家使用方法新手指南
手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc