热门搜索:和平精英 原神 街篮2 

您的位置:首页 > > 教程攻略 > ai资讯 >Gemini 3.5 Pro难产,谷歌先交了两张草稿纸

Gemini 3.5 Pro难产,谷歌先交了两张草稿纸

来源:互联网 更新时间:2026-07-22 13:15

7月21日,谷歌悄无声息地丢出了两个新模型:Gemini 3.6 Flash 和 Gemini 3.5 Flash-Lite。 没有预告,没有预热,它们就这么直接出现在了 Google AI Studio 和 Gemini 的模型选择器里。如果要用一句话来概括这次更新,那就是:谷歌在旗舰模型难产之际,先交了两张“草稿纸”。 Gemini 3.5 Pro难产,谷歌先交了两张草稿纸 这两个模型,一个主打更强的代码和 Agent 能力,另一个则瞄准更低成本的大规模调用。而作为旗舰担当的 Gemini 3.5 Pro,千呼万唤,依然没个影。 按照原计划,3.5 Pro 本该在6月上线,现在7月都快过完了,这款被寄予厚望的模型仍然没有正式亮相。旗舰答卷迟迟不交,先拿出两张“草稿纸”,这葫芦里到底卖的什么药?

3.6 Flash:比上一代便宜,但未必比上一代聪明

谷歌表示,相比上一代 Flash 模型,Gemini 3.6 Flash 在编码、推理和工具调用方面都有提升,同时通过减少输出 token 来降低运行成本。 Gemini 3.5 Pro难产,谷歌先交了两张草稿纸 Gemini 3.6 Flash 的定位很清楚:一个面向真实生产环境的高效模型,说得更直白点,就是为 Agent 服务。在 Agent 时代,一次任务可能需要几十轮模型调用,这意味着模型不仅要聪明,还必须足够快、足够便宜。 Google 此前已经在 Gemini 3.5 Flash 上强化了这条路线。根据最新 API 文档,Gemini 3.5 Flash 支持 100 万 token 的长上下文,能一次处理大量信息,同时支持代码执行、调用外部工具、搜索文件等能力,可以完成更复杂、更长时间的任务。Gemini 3.6 Flash 延续了这条路线,它追求的不是单次回答的质量,而是一个“能承担得起每日真实工作”的位置。 Gemini 3.6 Flash 的定价如下: * 输入:1.50 美元/百万 token * 输出:7.50 美元/百万 token 相比此前 Gemini 3.5 Flash 每百万 token 输入 1.5 美元、输出 9 美元的价格,输入成本没变,但输出成本进一步下降。对于需要大量调用 AI 的企业来说,这种成本变化可能比 benchmark 上几个百分点的提升更加重要。 另外,谷歌展示的一项内部测试显示,在完成同一任务时,Gemini 3.6 Flash 相比 3.5 Flash 减少了 55.8% 的 token 消耗,同时将任务评分从 85 分提升到了 100 分。当然,这只是谷歌自己的测试,但足以说明 Google 希望展示的方向:新模型不仅更省,而且能用更少的计算完成同样甚至更好的任务。 Gemini 3.5 Pro难产,谷歌先交了两张草稿纸 在那些公开的 benchmark 里,谷歌主要强调的是代码能力和 Agent 能力。在 DeepSWE 代码评测中,Gemini 3.6 Flash 得分 49%,高于上一代的 37%。谷歌表示,新模型能够减少无效代码修改和重复执行过程。在测试 AI 操作电脑能力的 OSWorld-Verified 评测中,Gemini 3.6 Flash 得分 83%,超过 3.5 Flash 的 78.4%。而在面向机器学习任务的 MLE Bench 中,Gemini 3.6 Flash 得分 63.9%,相比上一代的 49.7% 也有明显提升。 Gemini 3.5 Pro难产,谷歌先交了两张草稿纸 不过,这些数据更多说明的是 Gemini 3.6 Flash 相比上一代有所进步。如果放到当前大模型竞争中横向比较,Google 选择的对手是 GPT-5.6 Luna、Grok 4.5 和 Claude Sonnet 5。从结果来看,Gemini 3.6 Flash 并没有全面领先,GPT 和 Claude 的模型在复杂软件工程和知识工作任务上仍然保持优势。 但这其实也是 Flash 系列存在的意义:它不一定要成为最强模型,只需要在明显低于旗舰模型成本的情况下,提供够用的能力。 Gemini 3.5 Pro难产,谷歌先交了两张草稿纸 最新测评之外,根据 Artificial Analysis 的发布前测试,Gemini 3.6 Flash 在 Intelligence Index 上拿到了 50 分,与 Gemini 3.5 Flash 持平。这意味着,如果只看模型综合“智力”,Gemini 3.6 Flash 并没有什么升级。 Gemini 3.5 Pro难产,谷歌先交了两张草稿纸 但是呢,它的速度又很好地弥补了这一点。Artificial Analysis 还统计了模型完成 Intelligence Index 任务所需的平均时间。结果显示,Gemini 3.6 Flash 每项任务平均耗时约 1.3 分钟,相比上一代 3.5 Flash 的约 2.7 分钟,减少了一半。与此同时,Gemini 3.5 Flash-Lite 的任务完成时间也从上一代 3.1 Flash-Lite 的约 1.6 分钟,下降到约 0.6 分钟。 Gemini 3.5 Pro难产,谷歌先交了两张草稿纸 总的来说,Gemini 3.6 Flash 的升级方向其实是效率——更少的 token 消耗,更低的运行成本,以及更适合长期运行的 Agent 能力。对于习惯使用 Gemini 3.5 Flash 的用户来说,确实是非常不错的升级。

3.5 Flash-Lite:更快,但没上一代便宜

再来看另一个模型 Gemini 3.5 Flash-Lite。顾名思义,Flash-Lite 是 Flash 系列中更轻量的版本,相比 Flash,它牺牲了一部分能力上限,换取了更低的成本和更快的速度。 Gemini 3.5 Pro难产,谷歌先交了两张草稿纸 就像前面提到的,Gemini 3.5 Flash-Lite 的任务完成时间从上一代 3.1 Flash-Lite 的约 1.6 分钟,下降到了约 0.6 分钟。3.5 Flash-Lite 也是 3.5 系列中速度最快的型号,根据 Artificial Analysis 测试数据,其生成速度达到约 350 token/秒,已经属于当前主流大模型中的高速水平。 Gemini 3.5 Flash-Lite 的定价如下: * 输入:0.30 美元/百万 token * 输出:2.50 美元/百万 token 相比 Gemini 3.6 Flash,输入价格约为 1/5,输出价格约为 1/3。不过,与上一代 Gemini 3.1 Flash-Lite 相比,新模型并没有进一步降价。虽然 Gemini 3.5 Flash-Lite 由于能力提升,可以通过减少输出量降低部分成本,但综合起来,还是很难抵消单价上的成本增加。 根据最新文档,相比上一代 Gemini 3.1 Flash-Lite,新模型在不同思考等级下都有明显提升。开发者可以根据任务需求调整模型的思考深度。此外,Gemini 3.5 Flash-Lite 还内置了 Computer Use 能力,可以帮助 Agent 更可靠地操作电脑环境,完成跨应用任务。 在具体测试中,Gemini 3.5 Flash-Lite 相比上一代模型也有明显提升:在 Terminal-Bench 2.1 编程 Agent 测试中,成绩从 31% 提升到 54%;在测试长上下文理解能力的 GDM-MRCR v2 中,从 60.1% 提升到 72.2%;在更贴近真实工作场景的 GDPval-AA v2 任务执行测试中,从 642 提升到 1140。 Gemini 3.5 Pro难产,谷歌先交了两张草稿纸 值得注意的是,在一些 Agent 和代码相关测试中,Gemini 3.5 Flash-Lite 甚至超过了上一代更高定位的 Gemini 3 Flash 模型。例如,在 SWE-Bench Pro 软件工程测试中,Gemini 3.5 Flash-Lite 得分 54.2%,高于 Gemini 3 Flash 的 49.6%;在测试 AI 操作电脑能力的 OSWorld-Verified 中,Gemini 3.5 Flash-Lite 也以 74.0% 的成绩超过 Gemini 3 Flash 的 65.1%。 这意味着,随着模型能力不断提升,过去需要更大模型才能完成的部分 Agent 任务,正在逐渐下沉到更便宜、更快速的模型。 Gemini 3.5 Pro难产,谷歌先交了两张草稿纸 顺便一提,除了前两个面向普通用户的通用模型,谷歌还推出了 Gemini 3.5 Flash Cyber。它主要针对网络安全场景。根据最新文档,在 CodeMender 系统中,多个 Gemini 3.5 Flash Cyber Agent 可以协同工作,分别完成不同分析任务,并最终汇总成一份完整报告。在网络安全基准测试 CyberGym 中,Flash Cyber 也达到了接近前沿模型的表现。 Gemini 3.5 Pro难产,谷歌先交了两张草稿纸 该模型目前不会公开提供,仅通过 CodeMender 平台向政府和可信合作伙伴开放。

3.5 Pro:谷歌迟迟交不出的旗舰答卷

如果说 Gemini 3.6 Flash 和 Gemini 3.5 Flash-Lite 还可以看作是谷歌对 AI 规模化应用的判断,那么 Gemini 3.5 Pro 则代表着谷歌的模型上限。但问题在于:这份答卷,到现在还没有交出来。 5月I/O的时候,谷歌表示 Gemini 3.5 Pro 将在“接下来一个月左右”推出,也就是预计在今年6月上线。现在7月都过了一大半了。据彭博社7月16日报道,Gemini 3.5 Pro 的发布时间已经落后原计划数月。谷歌正在继续优化模型能力,尤其是编码表现,希望达到内部设定的目标。路透社最新的报道则显示,截至目前,谷歌仍未公布具体上线时间,只表示该模型正在与合作伙伴测试,并将“很快”推出;另有新闻稿透露,Gemini 4 的训练工作已经开始了。 而我们都知道,“很快”就是不确定的意思。 Gemini 3.5 Pro难产,谷歌先交了两张草稿纸 回顾一下,Gemini 1.0 发布时就曾因演示争议受到质疑;Gemini 1.5 Pro 凭借百万 token 上下文短暂扳回局面,但随后 Claude 和 GPT 系列快速追赶;直到 Gemini 3 系列发布,谷歌才重新获得“回到前沿竞争”的评价。如今 Gemini 3.5 Pro 再次延期,市场关注的已经不只是一个模型什么时候上线,还有谷歌到底能否保持旗舰模型的竞争节奏问题。 何况谷歌透露出的编码表现不及预期,并不是什么容易解决的小问题。随着 Agent 开始进入企业工作流,代码能力的重要性迅速提升。一个模型能否理解复杂项目、修改真实代码、完成多步骤开发任务,已经成为衡量它是否具备实际生产价值的重要指标。路透社指出,华尔街正在等待 Gemini 3.5 Pro,因为它将成为判断 Google DeepMind 是否能够跟上 OpenAI 和 Anthropic 的重要指标。 当然,谷歌并不是没有动作,这次推出的几个模型,恰恰说明谷歌正在强化另一条路线:让 AI 变得更便宜、更容易规模化。谷歌 CEO Sundar Pichai 近期也多次强调成本优势,并表示企业如果将大部分 AI 工作负载迁移到 Gemini 模型,可以每年节省超过 10 亿美元。 但问题在于,市场在期待一份证明谷歌模型实力的“答卷”,谷歌交出的却是两张关于效率和成本的“草稿纸”——很难不让人觉得,谷歌在用 Flash 系列填补 Pro 延迟留下的空档。 有意思的是,在 Gemini 3.5 Pro 延期的同时,AI 竞争格局正在发生变化。过去,人们讨论 AI 领先者,主要关注海外“御三家”:OpenAI、Anthropic 和 Google DeepMind。但最近,GLM-5.2、Kimi K3 等国产模型也开始进入前沿竞争,并引发了大量讨论。前沿模型的追赶速度正在加快,也让谷歌的问题变得更加紧迫。它当然可以继续大力推出 Flash 模型,但前提是它的旗舰模型足够给力——只要硬实力足够,自有大儒为他辩经。 如果谷歌最终推出一个真正领先的旗舰模型,那么 Flash 路线会成为完整体系的一部分:Pro 负责突破能力上限;Flash 负责规模化应用。但如果 Gemini 3.5 Pro 持续落后,市场很可能会继续追问:谷歌拥有最强 AI 研究资源,为什么却无法稳定跑赢竞争对手? 在 Alphabet 本周举行第二季度财报电话会议时,人们很可能会进一步询问有关 Gemini 3.5 Pro 的更多细节。

热门手游

相关攻略

手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc