来源:互联网 更新时间:2026-08-27 14:37
OpenAI o1 发布还不到 24 小时,整个行业就炸开了锅。各路测试数据、使用心得、团队分享扎堆涌来,其中不少信息值得仔细琢磨。下面把几个最关键的点捋一捋。
先看几项硬核测试结果。o1-preview 在 ARC-AGI 测试中拿下了 21%,而目前这个测试的最佳水平是 46%。这意味着什么?简单来说,o1 代表了一种从“记住答案”到“记住推理过程”的模式转变,但它并没有脱离更广泛的那套逻辑——通过调整曲线来适应已有分布,让所有输出都落在分布之内。换句话说,它依然在“拟合”,只是拟合的层次更高了。

代码编辑方面,o1-preview 在 aider 测试中得分约 80%,超过之前最佳 Claude 3.5 Sonnet 的 77%。不过有趣的是,o1-preview 在适应 aider 的差异编辑格式时有点水土不服,o1-mini 更是对全量和差异编辑格式都感到吃力。要知道 aider 对格式的要求已经相当宽松了,几乎愿意接受任何接近正确的输入。这么强大的模型却在简单的文本输出格式上翻车,说明 aider 那边可能需要调整提示词和编辑格式来配合 o1 的特性。

在 Cognition-Golden 测试中,o1-preview 得分约 52%。针对这类任务,有一个反常识的建议:以前我们惯用的思维链提示、让模型“大声思考”这些技巧,在 o1 身上反而可能起到反效果。让 o1 只给出最终答案往往表现更好,因为它会在回答之前自己默默思考。o1 需要更紧凑的上下文,对杂乱和多余的 token 非常敏感。传统提示里那些多余的指令,对 o1 而言其实是负资产。
Andrew Mayne 在使用 o1 几周后分享了几条非常实用的建议:
别把它当传统的聊天模型。把 o1 想象成一个非常聪明的朋友,你给她发私信求教,她会回复你一篇深思熟虑的讲解,一步步带你解决问题。写提示的时候建议先在记事本里打好草稿,提前规划好想要什么,把所有步骤解释清楚,给出比平时更多的细节。对于那些不需要太多世界知识、但需要逐步跟进的任务,就用 o1-mini。o1 通常会给出部分答案加完整回应,而 o1-mini 会直接给出步骤。如果你需要修正或调整,记得耐心解释要改什么——具备推理能力的模型,对经过推理的回应反应会更好。
另外,@btibor91 分享了 OpenAI 研究团队 AMA 的总结,信息量很大,按主题整理如下:
OpenAI o1 这个名字代表 AI 能力进入新水平,所以编号重置为 1。“Preview”表示这是完整模型的早期版本,“Mini”则是针对速度优化的小型版本。o 代表 OpenAI。o1 不是一个“系统”,它是一个经过训练的模型,会在返回最终答案之前生成长链思考。o1 的图标隐喻是一位拥有非凡能力的外星人。
o1-mini 比 o1-preview 小得多且更快,因此未来会向免费用户开放。o1-preview 是 o1 模型早期的检查点,既不算大也不算小。o1-mini 在 STEM 任务中表现优于 o1-preview,但世界知识有限。特别是在代码相关任务中,o1-mini 比 o1-preview 更强。o1 的输入 token 计算方式与 GPT-4o 相同,使用同一分词器。o1-mini 能够探索更多的思考链条,相比 o1-preview 更有探索空间。
o1 模型很快会支持更大的输入上下文。它能处理更长、更开放的任务,不像 GPT-4o 那样需要将输入分块。o1 在提供答案之前能够生成长链思考,这是之前模型做不到的。目前无法在 CoT 推理过程中暂停来添加更多上下文,但团队正在为未来模型探索这一功能。
o1-preview 尚未使用工具,但计划支持函数调用、代码解释器和浏览功能。未来更新会加入工具支持、结构化输出和系统提示。用户最终可能可以控制思考时间和 token 限制。流式处理也计划启用,API 中会考虑推理进度。o1 内置了多模态能力,在 MMMU 等任务中目标是达到最先进的性能。
o1 在推理过程中生成隐藏的思考链,没有计划向 API 用户或 ChatGPT 透露这些 CoT tokens。CoT tokens 会被总结,但不能保证与实际推理完全一致。提示中的指令可以影响模型如何思考问题。o1 使用强化学习来改进 CoT,而 GPT-4o 单靠提示无法匹配 o1 的 CoT 性能。思考阶段看起来较慢是因为它总结了思维过程,但答案生成通常更快。
o1-mini 对 ChatGPT Plus 用户每周有 50 个提示的限制,所有提示在 ChatGPT 中计数相同。未来会推出更多 API 访问层级和更高的速率限制。API 中的提示缓存是热门请求,但尚无时间表。
o1 模型的定价预计会遵循每 1-2 年降价的趋势。一旦速率限制增加,就会支持批量 API 定价。微调在计划中,但尚无时间表。扩展 o1 面临研究和工程人才的瓶颈。新的推理计算扩展范式可能在未来模型中带来显著提升。逆向扩展尚不显著,但个人写作提示显示 o1-preview 相比 GPT-4o 仅表现稍微好一些(或稍微差)。
o1 通过强化学习来训练推理性能。模型展现出创造性思维,在诗歌等侧向任务中表现强大。哲学推理和通用能力(比如解码密码)令人印象深刻。研究人员已用 o1 创建了一个 GitHub 机器人,自动联系合适的 CODEOWNERS 进行审查。内部测试中,o1 会自我测验难题来评估能力。广泛的世界知识正在增加,未来版本会改进。o1-mini 计划更新数据(目前为 2023 年 10 月)。
o1 受益于提供边缘案例或推理风格的提示。相比早期模型,o1 更能接受提示中的推理线索。在检索增强生成中提供相关上下文能提高性能,而不相关的内容则可能恶化推理效果。
由于处于早期测试阶段,o1-preview 的速率限制较低,但会逐步增加。延迟和推理时间正在积极改进。
o1 能够思考哲学性问题,比如“生命是什么?”研究人员发现 o1 在处理复杂任务和从有限指令泛化方面表现出色。它的创造性推理能力(比如自我测验)展示了高水平的问题解决能力。
腾讯ima怎么把微信内容一键导入知识库?
腾讯ima怎么创建共享知识库?
Celestia价格预测2026-2032:TIA币能否引领山寨币上涨行情?历史价格回顾
比特币(BTC)核心周期指标复刻历史走势 价格或跌破5.8万美元关键支撑位
比特币 2025 年价格预测:BTC 的未来走势
新浪互联网热点小时报丨2026年07月26日16时_今日实时互联网热点速递
WorkBuddy微信版怎么获得积分?
5000元起的鼠标哪个最值得入手?
新浪人工智能热点小时报丨2026年07月30日18时_今日实时人工智能热点速递
腾讯ima知识库怎么分类管理?
短剧《史上最强洪荒修为》剧情介绍
海尔消毒柜自动消毒如何中止
博世壁挂炉关闭暖气怎么操作
车载冰箱重置到出厂设置几步?
男生高性价比充电头?
SPX6900(SPX)币是什么?SPX币价格走势分析及未来展望
管线机怎么接云米净水器
WorkBuddy积分怎么获得?
5000-6000元鼠标有什么推荐?
Windy卫星云图怎么看?云层变化识别技巧
手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc