热门搜索:和平精英 原神 街篮2 

您的位置:首页 > > 教程攻略 > ai资讯 >Gemini 3.6 Flash来了,但网友笑得更大声:省下了token,却没保住智商

Gemini 3.6 Flash来了,但网友笑得更大声:省下了token,却没保住智商

来源:互联网 更新时间:2026-07-22 15:22

如果你从去年开始就持续关注Gemini,最近应该没少看到这样一句调侃:用Gemini的感觉,就像看着自家的兄弟慢慢得了阿尔茨海默症。按理说,一家公司发布新模型,正是用来打破这种尴尬印象的好机会。但就在刚刚,Google一口气甩出三款新模型之后,网友们的反应非但没有收敛,反而笑声更大了——颇有一种“他们都不看好你,偏偏你最不争气”的喜感。这三款模型分别是3.6Flash、3.5Flash-Lite,以及专攻网络安全的3.5Flash Cyber。官方博客的措辞依旧熟悉:更高效、更聪明、为大规模AI agent而生,一句不落。但实际体验下来,却是一场冰火两重天。

先说说当家头牌3.6Flash。作为今年5月I/O大会上3.5Flash的小版本迭代,它的官方定位是“真正扛活的干活模型”。这一代最大的卖点,就是省token。根据Artificial Analysis Index的数据,3.6Flash比3.5Flash少用了17%的输出token,在DeepSWE这类场景下甚至能省到65%。这意味着在跑多步任务时,推理步数和工具调用都更少。价格也确实是降了:输入1.5美元每百万token,输出7.5美元每百万token;而上一代3.5Flash的输出价是9美元,直接砍到了7.5。又快又省,单个agent任务的成本被压了下来。

image.png

再往下看,是价格更低的3.5Flash-Lite。它主打快和便宜,专治高吞吐、低延迟的任务,比如agent搜索和文档处理。论速度,3.5Flash-Lite是3.5系列里最快的,根据Artificial Analysis的测量,每秒能吐出350个token。价格更是白菜价:输入0.3美元、输出2.5美元每百万token,质量比3月份发布的3.1Flash-Lite要好一大截。它支持调推理档位,低负荷任务开最低档,图快和省;遇到需要多步拆解的子任务,就把思考档位往上拨。这次还内置了电脑操作工具。

提升相当明显:代码和agent任务的Terminal-Bench 2.1从31%干到了54%,长上下文的GDM-MRCR v2从60.1%提到72.2%,真实任务执行的GDPval-AA v2更是从642飙到1140。最有意思的是,这个低档小弟在不少agent和代码任务上,居然反超了辈分更高的3Flash——比如SWE-Bench Pro是54.2%对49.6%,OSWorld-Verified是74.0%对65.1%。等于说,跑3Flash的活儿,现在有了一个更快更强的平替。官方举了几个用法:从海量电商数据里抽产品特征、给3.6Flash当副手一口气生成25个网页设计方案、批量翻译总结收据、边玩边迭代做小游戏。Ashler、Palo Alto Networks、Ramp这几家客户也来夸它速度、智能、成本三合一。

最后一个3.5Flash Cyber画风突变,专门用来找和修代码里的安全漏洞。Google的逻辑挺妙:现在AI找漏洞的速度已经比现有系统修漏洞快多了,漏洞越堆越多,不如用便宜高效的Flash来批量补锅。这个模型在3.5Flash基础上微调出来,搭配自家的CodeMender工具,里面跑好几个Flash Cyber agent协同工作,最后汇总成一份报告。在业内知名的CyberGym基准上,它摸到了第一梯队水平,还比更大的模型更省token。不过,这模型暂时用不上——考虑到找漏洞是把双刃剑,Google也学Anthropic玩起了安全叙事,把它锁得死死的,只对可信合作伙伴限量开放、走内测。目的是给一线防守方争取时间,赶在漏洞被利用前先修掉,同时防着有人拿它去干坏事。

看到这儿你可能会问:发了一堆Flash,真正的旗舰3.5Pro去哪了?官方口径是正在和合作伙伴测试、准备好就上。但这套说辞背后的故事,可能没那么体面。据彭博社等媒体报道,3.5Pro的代码生成能力一直没达到内部预期。Google在6月下旬还专门更新了一版训练数据来补代码这块短板,结果成绩依旧没起色。更有传闻说,Google干脆推翻了原来的训练方案,从零开始重训。而Google AI的宣传委员Logan Kilpatrick,索性在舆论上跳过3.5Pro,把预告重点放在Gemini 4上,声称已经启动了“史上最雄心勃勃的Gemini 4预训练,进展让人兴奋”。放在旗舰跳票的背景下看,这多少有点转移视线、画饼续命的味道。

光看今天发布的Flash模型本身,网友也并不全然买账。第三方评测机构Artificial Analysis表示,两个新模型确实把单任务耗时砍半,token效率也提升了。Flash-Lite的智能指数涨了11分,但3.6Flash的智能水平相比3.5Flash基本原地踏步。价格没便宜到足以忽略能力差距,能力也没高到能解释它的成本。X平台上,一位网友的吐槽很直接:3.6Flash在Artificial Analysis上的评分和3.5Flash一模一样,但面对Meta Spark 1.1、GLM-5.2、5.6 Luna、Sonnet 5、Grok 4.5、5.6 Terra这一票对手,却显得底气不足,直呼“简直烂透了”。

网友Angel则从性价比入手,指出3.6Flash的使用成本比GPT-5.6 Sol medium还高,智能程度反而更低。“又贵又笨”的组合,属实尴尬。毕竟Flash系列立身的根本就是性价比,结果被人当场指出性价比不如对手,等于自砸招牌。作为对比,OpenAI的Tibo刚刚也发话,由于周活跃用户达到1000万,Codex和ChatGPT Work的付费用户迎来了新一轮额度重置。这对比、这落差,还有人记得大明湖畔的Google Gemini 3吗?

实测派也来补刀。网友Balder直接开团,称这三个模型性能全比之前的3.5Flash差,问题包括但不限于:基础解码就有毛病,中文选词经常很离谱;生成的图片视频质量极差,跟指令对不上还限额严重;经常记忆混乱,调用完全错误的工具。他还抛出一个阴谋论,认为Google之所以这么搞,是为了把算力腾出来卖给Anthropic,阴阳了一句“这就是皮查伊想要的Cloud First”。X网友Conor Dart用Google自家的Antigra vity跑了个AI生成游戏测试,结果木头纹理更差了,大理石看着差不多但还是不能用。他直言“又是一次翻车”,表示自己还是等Gemini 3.5或者3.6 Pro吧。

一边是官方“更高效、更便宜、更省token”的漂亮账本,一边是大多数网友的当场差评,以及模型背后旗舰跳票、大牛出走、市值缩水等一连串糟心事。这很难不让人好奇:Google这次是不是真点歪了科技树,光顾着省成本,忘了提智商?只能先靠几个Flash稳住场子。反正Gemini 4的预训练已经开跑了,这一把要是再翻车,那句“阿尔茨海默”的玩笑,可就真要成谶语了。

热门手游

手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc