来源:互联网 更新时间:2026-07-22 13:15
这两个模型,一个主打更强的代码和 Agent 能力,另一个则瞄准更低成本的大规模调用。而作为旗舰担当的 Gemini 3.5 Pro,千呼万唤,依然没个影。
按照原计划,3.5 Pro 本该在6月上线,现在7月都快过完了,这款被寄予厚望的模型仍然没有正式亮相。旗舰答卷迟迟不交,先拿出两张“草稿纸”,这葫芦里到底卖的什么药?
Gemini 3.6 Flash 的定位很清楚:一个面向真实生产环境的高效模型,说得更直白点,就是为 Agent 服务。在 Agent 时代,一次任务可能需要几十轮模型调用,这意味着模型不仅要聪明,还必须足够快、足够便宜。
Google 此前已经在 Gemini 3.5 Flash 上强化了这条路线。根据最新 API 文档,Gemini 3.5 Flash 支持 100 万 token 的长上下文,能一次处理大量信息,同时支持代码执行、调用外部工具、搜索文件等能力,可以完成更复杂、更长时间的任务。Gemini 3.6 Flash 延续了这条路线,它追求的不是单次回答的质量,而是一个“能承担得起每日真实工作”的位置。
Gemini 3.6 Flash 的定价如下:
* 输入:1.50 美元/百万 token
* 输出:7.50 美元/百万 token
相比此前 Gemini 3.5 Flash 每百万 token 输入 1.5 美元、输出 9 美元的价格,输入成本没变,但输出成本进一步下降。对于需要大量调用 AI 的企业来说,这种成本变化可能比 benchmark 上几个百分点的提升更加重要。
另外,谷歌展示的一项内部测试显示,在完成同一任务时,Gemini 3.6 Flash 相比 3.5 Flash 减少了 55.8% 的 token 消耗,同时将任务评分从 85 分提升到了 100 分。当然,这只是谷歌自己的测试,但足以说明 Google 希望展示的方向:新模型不仅更省,而且能用更少的计算完成同样甚至更好的任务。
在那些公开的 benchmark 里,谷歌主要强调的是代码能力和 Agent 能力。在 DeepSWE 代码评测中,Gemini 3.6 Flash 得分 49%,高于上一代的 37%。谷歌表示,新模型能够减少无效代码修改和重复执行过程。在测试 AI 操作电脑能力的 OSWorld-Verified 评测中,Gemini 3.6 Flash 得分 83%,超过 3.5 Flash 的 78.4%。而在面向机器学习任务的 MLE Bench 中,Gemini 3.6 Flash 得分 63.9%,相比上一代的 49.7% 也有明显提升。
不过,这些数据更多说明的是 Gemini 3.6 Flash 相比上一代有所进步。如果放到当前大模型竞争中横向比较,Google 选择的对手是 GPT-5.6 Luna、Grok 4.5 和 Claude Sonnet 5。从结果来看,Gemini 3.6 Flash 并没有全面领先,GPT 和 Claude 的模型在复杂软件工程和知识工作任务上仍然保持优势。
但这其实也是 Flash 系列存在的意义:它不一定要成为最强模型,只需要在明显低于旗舰模型成本的情况下,提供够用的能力。
最新测评之外,根据 Artificial Analysis 的发布前测试,Gemini 3.6 Flash 在 Intelligence Index 上拿到了 50 分,与 Gemini 3.5 Flash 持平。这意味着,如果只看模型综合“智力”,Gemini 3.6 Flash 并没有什么升级。
但是呢,它的速度又很好地弥补了这一点。Artificial Analysis 还统计了模型完成 Intelligence Index 任务所需的平均时间。结果显示,Gemini 3.6 Flash 每项任务平均耗时约 1.3 分钟,相比上一代 3.5 Flash 的约 2.7 分钟,减少了一半。与此同时,Gemini 3.5 Flash-Lite 的任务完成时间也从上一代 3.1 Flash-Lite 的约 1.6 分钟,下降到约 0.6 分钟。
总的来说,Gemini 3.6 Flash 的升级方向其实是效率——更少的 token 消耗,更低的运行成本,以及更适合长期运行的 Agent 能力。对于习惯使用 Gemini 3.5 Flash 的用户来说,确实是非常不错的升级。
就像前面提到的,Gemini 3.5 Flash-Lite 的任务完成时间从上一代 3.1 Flash-Lite 的约 1.6 分钟,下降到了约 0.6 分钟。3.5 Flash-Lite 也是 3.5 系列中速度最快的型号,根据 Artificial Analysis 测试数据,其生成速度达到约 350 token/秒,已经属于当前主流大模型中的高速水平。
Gemini 3.5 Flash-Lite 的定价如下:
* 输入:0.30 美元/百万 token
* 输出:2.50 美元/百万 token
相比 Gemini 3.6 Flash,输入价格约为 1/5,输出价格约为 1/3。不过,与上一代 Gemini 3.1 Flash-Lite 相比,新模型并没有进一步降价。虽然 Gemini 3.5 Flash-Lite 由于能力提升,可以通过减少输出量降低部分成本,但综合起来,还是很难抵消单价上的成本增加。
根据最新文档,相比上一代 Gemini 3.1 Flash-Lite,新模型在不同思考等级下都有明显提升。开发者可以根据任务需求调整模型的思考深度。此外,Gemini 3.5 Flash-Lite 还内置了 Computer Use 能力,可以帮助 Agent 更可靠地操作电脑环境,完成跨应用任务。
在具体测试中,Gemini 3.5 Flash-Lite 相比上一代模型也有明显提升:在 Terminal-Bench 2.1 编程 Agent 测试中,成绩从 31% 提升到 54%;在测试长上下文理解能力的 GDM-MRCR v2 中,从 60.1% 提升到 72.2%;在更贴近真实工作场景的 GDPval-AA v2 任务执行测试中,从 642 提升到 1140。
值得注意的是,在一些 Agent 和代码相关测试中,Gemini 3.5 Flash-Lite 甚至超过了上一代更高定位的 Gemini 3 Flash 模型。例如,在 SWE-Bench Pro 软件工程测试中,Gemini 3.5 Flash-Lite 得分 54.2%,高于 Gemini 3 Flash 的 49.6%;在测试 AI 操作电脑能力的 OSWorld-Verified 中,Gemini 3.5 Flash-Lite 也以 74.0% 的成绩超过 Gemini 3 Flash 的 65.1%。
这意味着,随着模型能力不断提升,过去需要更大模型才能完成的部分 Agent 任务,正在逐渐下沉到更便宜、更快速的模型。
顺便一提,除了前两个面向普通用户的通用模型,谷歌还推出了 Gemini 3.5 Flash Cyber。它主要针对网络安全场景。根据最新文档,在 CodeMender 系统中,多个 Gemini 3.5 Flash Cyber Agent 可以协同工作,分别完成不同分析任务,并最终汇总成一份完整报告。在网络安全基准测试 CyberGym 中,Flash Cyber 也达到了接近前沿模型的表现。
该模型目前不会公开提供,仅通过 CodeMender 平台向政府和可信合作伙伴开放。
回顾一下,Gemini 1.0 发布时就曾因演示争议受到质疑;Gemini 1.5 Pro 凭借百万 token 上下文短暂扳回局面,但随后 Claude 和 GPT 系列快速追赶;直到 Gemini 3 系列发布,谷歌才重新获得“回到前沿竞争”的评价。如今 Gemini 3.5 Pro 再次延期,市场关注的已经不只是一个模型什么时候上线,还有谷歌到底能否保持旗舰模型的竞争节奏问题。
何况谷歌透露出的编码表现不及预期,并不是什么容易解决的小问题。随着 Agent 开始进入企业工作流,代码能力的重要性迅速提升。一个模型能否理解复杂项目、修改真实代码、完成多步骤开发任务,已经成为衡量它是否具备实际生产价值的重要指标。路透社指出,华尔街正在等待 Gemini 3.5 Pro,因为它将成为判断 Google DeepMind 是否能够跟上 OpenAI 和 Anthropic 的重要指标。
当然,谷歌并不是没有动作,这次推出的几个模型,恰恰说明谷歌正在强化另一条路线:让 AI 变得更便宜、更容易规模化。谷歌 CEO Sundar Pichai 近期也多次强调成本优势,并表示企业如果将大部分 AI 工作负载迁移到 Gemini 模型,可以每年节省超过 10 亿美元。
但问题在于,市场在期待一份证明谷歌模型实力的“答卷”,谷歌交出的却是两张关于效率和成本的“草稿纸”——很难不让人觉得,谷歌在用 Flash 系列填补 Pro 延迟留下的空档。
有意思的是,在 Gemini 3.5 Pro 延期的同时,AI 竞争格局正在发生变化。过去,人们讨论 AI 领先者,主要关注海外“御三家”:OpenAI、Anthropic 和 Google DeepMind。但最近,GLM-5.2、Kimi K3 等国产模型也开始进入前沿竞争,并引发了大量讨论。前沿模型的追赶速度正在加快,也让谷歌的问题变得更加紧迫。它当然可以继续大力推出 Flash 模型,但前提是它的旗舰模型足够给力——只要硬实力足够,自有大儒为他辩经。
如果谷歌最终推出一个真正领先的旗舰模型,那么 Flash 路线会成为完整体系的一部分:Pro 负责突破能力上限;Flash 负责规模化应用。但如果 Gemini 3.5 Pro 持续落后,市场很可能会继续追问:谷歌拥有最强 AI 研究资源,为什么却无法稳定跑赢竞争对手?
在 Alphabet 本周举行第二季度财报电话会议时,人们很可能会进一步询问有关 Gemini 3.5 Pro 的更多细节。 七麦数据官网网页地址 七麦数据官方入口在线首页
问卷星官方网站入口地址 问卷星网页版在线使用
币安Binance官方中文网站 币安App最新版下载及新手注册指南
闲鱼的严选验货在哪里看?闲鱼严选和验货宝哪个可靠
PokePay加密卡2026完整指南:申请开卡全攻略+多场景应用技巧
淘宝直播如何看回放在哪里看?怎么查看淘宝直播回放
摩托车活塞环性能如何
为何比特币BTC价格跌破7.3万美元?一文拆解影响近期比特币行情的五大原因
豆包AI专业版使用教程【新手必看】
索尼限时赠送PS Plus Premium七日会员,需手
ThinkBook系列最新价格全解析:2026年选购避坑与实时询价指南
迷你网名古风男生霸气(精选100个)
文雅简易网名男生可爱(精选100个)
GPT5.6惨遭切脑,Fable 5回归要变弱鸡版?
《梦幻西游》特殊鬼怪怎么抓-隐藏变异鬼应对要点
币圈十大实用工具:从实时行情监控到数据分析、资产管理
王者荣耀「西行封妖记」【孙权-仙扇使者】6月25日上线!
闲鱼严选和验货宝哪个可靠?闲鱼的验货宝怎么样,,
币安杀入美股市场,重头戏bStocks还没来
陈姓和杨姓网名大全男生(精选100个)
手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc