热门搜索:和平精英 原神 街篮2 

您的位置:首页 > > 教程攻略 > ai资讯 >「草莓」实测:可能只是工程 Trick,且有扣费陷阱!

「草莓」实测:可能只是工程 Trick,且有扣费陷阱!

来源:互联网 更新时间:2026-08-27 14:28

长话短说

中国时间 9 月 13 日凌晨,OpenAI 正式发布了 o1 系列模型——o1-preview 和 o1-mini,官方确认就是此前传得沸沸扬扬的「草莓」模型。从公布的数据来看,

o1 在 STEM(理工科)领域做了特别优化,回答之前会经历一段思考过程

。在物理、生物和化学问题(GPQA)的基准测试中,它直接超越了人类博士水平的准确性。

Plus 和 Team 用户现在就能在 ChatGPT 里访问

,不过限制不小:o1-preview 每周 30 条,o1-mini 每周 50 条。

T5 级别的开发者可以用 API

,每分钟最多 20 并发,价格也不便宜。

需要强调的是,

这个模型目前还是个半成品,离完整工程化还有距离

:ChatGPT 里不支持联网、画图等功能;API 里也不支持 system、tool 等字段,以及 json mode、结构化输出等方法。

而且,

这里有个坑——你可能会被百倍计费

。从 pricing table 看,o1 价格是 4o 的 6 倍,但实际不止——o1 计费不按最终输出,思考过程中的 token 也会被当作 output tokens 收取。也就是说,100 tokens 的内容输出,可能被按 10000 tokens 计费。

另外,

模型标称有 32k/64k 的最大输出,但真实输出远没那么多

。从实际测试来看,与其说 o1 是一个独立模型,不如说它是

基于 GPT-4o 的 agent,而且做得并不好

上图是进行结构化输出时的 400 报错。

效果与特性

先确认一下,o1 就是官方认定的「草莓」。

奥特曼本人对此也很满意。

在测试结果中,o1 在绝大多数重推理任务中显著优于 GPT-4o。整体来看,o1 的表现碾压了 4o,尤其在 MMLU 的多数子类别中优势明显。

根据官方报告,许多需要推理的测试里,o1 已经达到了人类专家的水平。像 MATH 和 GSM8K 这类测试,近期模型分数都太高了,已经分不出高下。因此官方选择了更具挑战性的 AIME(美国数学邀请赛)——这是一项专为全美顶尖高中数学学生设计的考试。

在 2024 年 AIME 中,GPT-4o 的平均成绩只有 12%(1.8/15),而 o1 平均得分高达 74%(11.1/15)。只用单次回答时,64 个样本的平均正确率达到 83%(12.5/15)。如果使用学习算法对 1000 个样本进行优化排序,o1 的得分进一步提高到 93%(13.9/15)。这个成绩足以进入全国前 500 名,甚至超过了美国数学奥林匹克的入围线。

价格与限制

目前 o1 系列模型可以通过 ChatGPT 网页版或 API 访问:

  • o1-preview

    • 128k 上下文
    • 32k 最大输出
    • 旨在解决各领域复杂问题的推理模型
    • 训练数据截止于 23 年 10 月
  • o1-mini

    • 128k 上下文
    • 64k 最大输出
    • 更快速、更经济的推理模型,特别擅长编程、数学和科学
    • 训练数据截止于 23 年 10 月

ChatGPT 网页版目前仅 Plus 和 Team 用户可用,Enterprise 和 Edu 用户还需等一周:

  • o1-preview:30 条/周
  • o1-mini:50 条/周

API 调用方面,Tire5(支付金额超过 1000 美金)的用户已经可以用:

  • o1-preview:20 RPM,30,000,000 TPM
  • o1-mini:20 RPM,150,000,000 TPM

需要注意

经测试,o1 模型不支持以下功能,调用会报错:

  • system 字段:400 报错
  • tools 字段:400 报错
  • 图片输入:400 报错
  • json_object 输出:500 报错
  • structured 输出:400 报错
  • logprobs 输出:403 报错
  • stream 输出:400 报错
  • 其他:temperature、top_p 和 n 被固定为 1;presence_penalty 和 frequency_penalty 固定为 0

进行结构化输出时,400 报错(见上图)。

更需要注意

文档说 o1 可以输出 64k,但实测远非如此。比如 prompt 为「写一部『黑神话悟空』的同人小说,不少于 2 万字」,返回的内容只有 1000+ 字。

「谨防电信反诈」

实现原理

简单来说,o1 系列模型在回答过程中会经历多次内部对话,根据对话评估再进行后续生成。它先思考,然后总结输出。

这个思考可能不止一步,最长的思考步骤可达 128k。具体流程如下:先思考,再总结输出。

但需要注意:API 调用时并不会返回中间的思考过程。比如同样的问题「安徽牛肉板面,为什么是石家庄特产?」,API 的返回里隐藏了推理过程。下图显示此处产生了 896 tokens 的推理(ID 等信息已隐去)。

换个例子,问题简短的「你好」,返回如下:输出 471 tokens,其中 448 tokens 是推理,只有 23 个是真实输出。

同样的问题用 4o 问:输出只有 9 tokens。

要知道,o1 模型的价格是 4o-0806 的 6 倍。再加上推理的额外消耗,以及 o1 的 token 计算可能比 4o 更多,API 开支可能会炸!

以「你好」为例,4o-0806 的费用是 ($10*9 + $2.5*8) * 10^-6 = 110 * 10^-6 美元;而 o1 模型费用是 ($60*471 + $15*10) * 10^-6 = 28410 * 10^-6 美元。

完成相同的任务,o1 比 4o 贵了足足 258 倍!

对于非极端问题且 prompt 较短的情况,比如「安徽牛肉板面,为什么是石家庄特产?」,4o-0806 的开销为 2192.5 * 10^-6 美元,而 o1 的开销为 86835 * 10^-6 美元。

在这个案例中,o1 比 4o 贵了 40 倍!

可以合理推断:在日常使用中,o1 的开销通常会比 4o 贵上百倍。

一些判断

首先,保持一个观点:

这次的「草莓」,与其说是模型优化,不如说是工程优化

。从训练数据和训练时间来看,o1-preview、o1-mini、4o、4o-mini 的训练数据都截止到 2023 年 10 月(而更早的 gpt-4-0125 和 gpt-4-turbo 则截止到 2023 年 12 月)。

去掉 CoT 行为后,可以发现 o1 和 4o 的行为、语言风格高度相似。甚至可以猜测:

这次的「草莓」o1 有可能是 gpt-4o 经过微调或对齐后的 agent

。当询问「我的猫为什么不会汪汪叫」时,出现了典型的「意图识别」现象。

同时,这个 agent 做得并不好,甚至不能算是及格。用 o1-mini 进行「完整输出千字文」时,无论是语言识别、意图识别还是指令遵循,都非常不尽如人意。即便换用更强的 o1-preview,结果也不理想(选中文字是错的),输出也不全。

(此处有两张截图,展示 o1-mini 和 o1-preview 的失败输出)

综上

这个版本的草莓,

远低于预期,甚至不如民间的工程化实现

。作为 AI 从业者,有种难以言表的伤感:我们喜欢看 OpenAI 的乐子,但绝对不希望看到 OpenAI 真的塌下去。

关于宇宙的好的网名有哪些
关于宇宙的好的网名有哪些

类型:角色扮演

大小:1

语言:简体中文

平台:互联网

游戏下载

热门手游

手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc