热门搜索:和平精英 原神 街篮2 

您的位置:首页 > > 教程攻略 > ai资讯 >OpenAI公布秘术:两个设置,GPT-5.6 Sol ARC-AGI-3成绩暴涨3倍!

OpenAI公布秘术:两个设置,GPT-5.6 Sol ARC-AGI-3成绩暴涨3倍!

来源:互联网 更新时间:2026-08-02 12:14

今天,一直对技术细节讳莫如深的 OpenAI,终于难得地敞开了一回大门。按照 Sam Altman 的说法,他们放出了一篇“goblin-level”的博客——只改了

两个设置

,就让模型在 ARC-AGI-3 上的得分提升了整整

3 倍

官方博客链接:https://openai.com/index/how-two-settings-tripled-our-arc-agi-3-scores/

具体来说,在官方测试框架下,GPT-5.6 Sol 在 ARC-AGI-3 公共测试集上的得分只有

13.3%

;但换用了与 ChatGPT、Codex 更接近的运行方式后,得分直接飙升至

38.3%

——约提升

3 倍

。模型本身没变,变的就是那两个设置。

这背后揭示了一个关键问题:长期运行的 Agent,如果无法保留自己的推理过程,也无法有效压缩历史上下文,就很难基于过去的经验持续学习。而更让人头疼的是,当 AI Agent 开始执行越来越长、越来越复杂的任务时,我们评测的,到底是模型本身,还是模型所处的运行环境?

以下是博客的全文内容。

如图所示,在长时间任务中,GPT-5.6 Sol 会将此前累积的推理过程压缩为摘要,并继续基于压缩后的上下文进行推理,从而避免随着任务增长丢失早期信息。

写在最后

OpenAI 表示,这次实验希望提醒开发者:基准测试很少只测量模型本身。它们同时也受到 API 设置、测试框架设计以及提示词方式的影响。对于希望最大化模型性能的 API 开发者,OpenAI 建议采用与自身产品一致的配置;对于模型之间的比较,也建议参考采用这些设置的评测结果,因为它们更接近 ChatGPT 和 Codex 中的真实使用环境。

ARC-AGI-3 为了保证评测公平,采用了一个统一、简化的测试框架,但这个框架没有考虑到 Agent 产品中的一些关键能力(如推理保留、上下文压缩),导致模型表现被低估。这么说来,未来衡量模型能力,可能还需要一个更接近实际使用场景的评测体系。

热门手游

相关攻略

手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc