来源:互联网 更新时间:2026-08-02 12:14
今天,一直对技术细节讳莫如深的 OpenAI,终于难得地敞开了一回大门。按照 Sam Altman 的说法,他们放出了一篇“goblin-level”的博客——只改了
官方博客链接:https://openai.com/index/how-two-settings-tripled-our-arc-agi-3-scores/
具体来说,在官方测试框架下,GPT-5.6 Sol 在 ARC-AGI-3 公共测试集上的得分只有
这背后揭示了一个关键问题:长期运行的 Agent,如果无法保留自己的推理过程,也无法有效压缩历史上下文,就很难基于过去的经验持续学习。而更让人头疼的是,当 AI Agent 开始执行越来越长、越来越复杂的任务时,我们评测的,到底是模型本身,还是模型所处的运行环境?
以下是博客的全文内容。
如图所示,在长时间任务中,GPT-5.6 Sol 会将此前累积的推理过程压缩为摘要,并继续基于压缩后的上下文进行推理,从而避免随着任务增长丢失早期信息。
OpenAI 表示,这次实验希望提醒开发者:基准测试很少只测量模型本身。它们同时也受到 API 设置、测试框架设计以及提示词方式的影响。对于希望最大化模型性能的 API 开发者,OpenAI 建议采用与自身产品一致的配置;对于模型之间的比较,也建议参考采用这些设置的评测结果,因为它们更接近 ChatGPT 和 Codex 中的真实使用环境。
ARC-AGI-3 为了保证评测公平,采用了一个统一、简化的测试框架,但这个框架没有考虑到 Agent 产品中的一些关键能力(如推理保留、上下文压缩),导致模型表现被低估。这么说来,未来衡量模型能力,可能还需要一个更接近实际使用场景的评测体系。
Ondo将于今日上线股票永续合约
晶核艾尔莎角色盘点 晶核艾尔莎强度分析与实战表现
黄金价格不断创新高!黄金稳定币XAU、PAXG市值达11亿美元
Intel喜讯连连:18A工艺良率提升到85%、CPU将涨价15%
区块链OTC交易所有哪几家比较正规?
CC币价格预测(2026-2035):Canton币今日价格走势+长期价格预测
新浪机器学习热点小时报丨2026年07月25日18时_今日实时机器学习热点速递
AMD英特尔集体失眠!英伟达Rosa CPU搭载Rigel核:单核性能碾压x86
遗忘之海密室通关教程 遗忘之海密室全关卡解谜思路与难点解析
macOS 28将移除Rosetta 2兼容层,Intel应用面临运行危机
异环伊洛伊阵容怎么搭配
《探索流放之路物品等级的奥秘》 揭秘物品等级的效果和怎么查看
新破天一剑太极刀任务攻略 破天一剑怎么取太极刀
潜水员戴夫丛林DLC接吻的鱼任务攻略
电视剧《白领公寓》剧情介绍
五千元以下的笔记本几乎消失!经销商:至少一年看不到涨价尽头
电视剧《钟鼓楼》剧情介绍
Windows环境下Claude Code从C盘迁移至D盘的完整操作教程
AMD Zen6处理器跑分还再涨!同核心提升达35%
华为Mate 70系列首发的红枫镜头下放至千元档:全员普及原色影像
手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc