美国当地时间7月21日,谷歌DeepMind团队一口气放出三款新的Gemini模型:Gemini 3.6 Flash、Gemini 3.5 Flash-Lite以及Gemini 3.5 Flash Cyber。
其中,主力模型Gemini 3.6 Flash在编码和多模态任务上表现更强,但更关键的是,它处理相同工作所消耗的输出token比前代减少了17%到65%。
Gemini 3.5 Flash-Lite主打极致的速度与性价比,每秒可生成350个输出token。
而Gemini 3.5 Flash Cyber则是一款针对网络安全漏洞检测与修复进行微调的专用模型,目前仅向政府和特定合作伙伴开放。
与此同时,外界期待已久的旗舰模型Gemini 3.5 Pro依然没有露面,谷歌表示它正在与合作伙伴进行测试,并首次透露,更庞大的Gemini 4预训练工作已经启动。
在大语言模型的应用成本中,输出token的数量直接关联到费用与延迟。Gemini 3.6 Flash的设计目标之一,就是降低这种不必要的消耗,同时保持或增强任务完成的质量。
第三方基准测试机构Artificial Analysis Index的实测显示,该模型输出token使用量较前代降低了17%。在需要多步骤推理和工具调用的复杂工程任务中,节省效果更为明显。
例如在Datacurve的DeepSWE基准测试中,token消耗减少了65%,这意味着Gemini 3.6 Flash在完成任务时执行了更少的冗余代码编辑和循环操作。
这种效率提升还带来了直接的价格下降。
Gemini 3.6 Flash定价为每百万输入token 1.50美元,每百万输出token 7.50美元。相较于3.5 Flash每百万输出token 9美元的价格,单次智能体任务的总成本有所降低。
性能方面,Gemini 3.6 Flash在多个基准测试中取得了可量化的提升。
DeepSWE测试中得分为49%,高于3.5 Flash的37%。MLE-Bench机器学习工程基准测试中,得分从49.7%提升至63.9%。
计算机使用能力在OSWorld-Verified测试中得分为83%,此前为78.4%,该功能现已成为Gemini API和Gemini Enterprise的内置客户端工具。
知识工作方面,GDPval-AA v2基准上的得分从1349提升至1421。
多家客户已经给出反馈。
Figma、Harvey、Hebbia和JetBrains均表示,Gemini 3.6 Flash在处理复杂工作流和知识型任务时,在token效率、准确性和速度之间取得了平衡。
谷歌展示了Gemini 3.6 Flash在几个实际场景中的表现。
在金融领域,该模型使用AI Studio上的Managed Agents,能够比Gemini 3.5 Flash更高效、更准确地解析和分析财务数据及记录。
在代码迁移任务中,Gemini 3.6 Flash在Antigravity平台上借助多智能体编排执行操作,比前代具有更低的延迟和更高的质量。
在创意工具方面,Gemini 3.6 Flash利用视觉理解能力,通过Antigravity和tldraw开源绘图工具构建了一个交互式主题工作室。
此外,该模型还使用Gemini App中的画布功能,帮助开发者制作了一个用于3D工作流的摄影纹理提取器。
Gemini 3.6 Flash追求的是效率平衡,Gemini 3.5 Flash-Lite追求的则是速度极限。
谷歌将其定义为3.5系列中“最快、最具成本效益”的模型。根据Artificial Analysis的实测,它的生成速度达到每秒350个输出token,这大约是上一代3.1 Flash-Lite速度的两倍。
定价也极具竞争力,每百万输入token 0.30美元,输出token 2.50美元。这种低成本和高速度,瞄准的是高吞吐量的业务场景,例如智能体搜索、大规模文档处理等。
虽然名字中带有Lite,但Gemini 3.5 Flash-Lite在SWE-Bench Pro测试中,得分54.2%,超过了标准版Gemini 3 Flash的49.6%。在OSWorld-Verified测试中,它以74%的成绩优于Gemini 3 Flash的65.1%。
开发者还能根据工作负载调整模型的“思考层级”:处理简单的高容量任务时,可设为最低思考以换取低延迟和低成本;面对复杂子智能体任务时,再提高思考层级保证质量。
谷歌公布了Gemini 3.5 Flash-Lite在四个场景中的演示案例。
第一个是从海量电子商务数据集中提取产品特征并进行整合。
第二个是作为主智能体与Gemini 3.5 Flash-Lite协同工作,即时生成25个独特的、可随时探索的网页设计概念。
第三个是利用多模态理解能力,大规模进行收据翻译和摘要。
第四个是通过即时生成并迭代多个选项来构建游戏。
早期客户Ashler、Paloalto和Ramp均强调了该模型在速度、智能和成本效益方面的独特组合,认为其适用于扩展智能体工作流和数据处理任务。
谷歌发布的第三款模型Gemini 3.5 Flash Cyber,是专门用来发现和修补网络安全漏洞的。
这款模型基于Gemini 3.5 Flash进行微调,谷歌希望它能以更低的token成本,去完成那些通常交给大模型的代码安全任务。在名为CyberGym的基准测试中,它的表现已经达到了前沿水平。
不过,鉴于网络攻防的双刃剑性质,谷歌对这款模型采取了审慎的交付策略。它不会面向所有开发者开放,而是直接集成到谷歌的代码安全智能体CodeMender中,作为一个有限访问试点项目,仅独家提供给政府和受信任的合作伙伴。
谷歌Gemini团队产品管理高级总监图尔西·多希表示,这是为了让一线的防御者能在关键漏洞被广泛利用前,抢先一步发现并修复它们,降低被滥用的风险。
谷歌透露,在内部测试中,这个模型在开源代码库V8 JavaScript Engine中找出了55个问题,其中10个漏洞是其他模型未能发现的。
从三款新模型的布局能看出,谷歌当前的策略是在效率上建立优势。
当下,越来越多的企业开始审视AI投入产出比,意识到大量消耗token并不总能换来好结果。谷歌CEO桑达尔·皮查伊在今年早些时候就提过,有的公司5月份就花完了全年的token预算,如果能混合使用Flash模型和其他前沿模型,能节省大量资金。
这种思路反映在产品上,就是不断压低成本、提高速度,同时增强模型处理具体任务的能力。
伴随这些高性能指标,安全也是必须要做的功课。Gemini 3.6 Flash在化学、生物、放射性、核(CBRN)以及网络攻击滥用方面,都加强了前沿安全防护,提升了抵御越狱攻击的能力,同时尽量减少对正常有益用途的拒绝。
对于普通用户和开发者,这些模型自发布当天就可以在Google AI Studio、Android Studio和Gemini应用里用到,同时可在Google Antigravity及Gemini Enterprise应用中使用。
Gemini 3.5 Flash-Lite还会逐步在谷歌搜索引擎中推开。Gemini 3.5 Flash Cyber,将通过CodeMender以邀请制落地。
尽管Flash模型陆续到位,但开发者社区更关心的问题始终是:Gemini 3.5 Pro何时发布?
谷歌上一次更新Pro系列模型是在今年2月发布的Gemini 3.1 Pro。此后,竞争对手的旗舰产品持续迭代。
OpenAI先后发布了GPT-5.5并开始推出GPT-5.6,Anthropic推出了Claude Opus 4.8和Claude Sonnet 5,并扩大了前沿模型Fable 5的访问权限。
今年5月,谷歌在发布Gemini 3.5 Flash时曾预告Pro版本已在内部使用,预期一个月内推出。如今已至7月末,该模型仍处于未公开状态。彭博社此前报道称,谷歌因难以达到内部性能目标,在推出3.5 Pro方面面临内部延迟。
对此,谷歌DeepMind技术负责人洛根·基尔帕特里克在社交媒体上回应说,Gemini 3.5 Pro正在与合作伙伴进行测试,计划在准备就绪后立即广泛提供。但他没有给出具体的时间节点。
谷歌方面并未详细解释延期原因,但在公布Flash系列的同时,首次正式提及了下一代旗舰模型Gemini 4的进展。团队表示,已经启动了Gemini 4的预训练工作,并称其为“迄今为止最雄心勃勃的预训练工作”。
这在一定程度上表明,谷歌的模型研发管线仍在持续推进,而3.5 Pro的交付节奏可能受内部测试和性能目标的影响。
美国网络科技媒体BI表示,截至Flash系列新模型发布当天,在Artificial Analysis的数学和推理等综合基准测试中,谷歌还没有一款模型进入该排行榜前十名。
新模型开放访问后,开发者社区很快传出了相当数量的负面声音。这些反馈主要集中在3.6 Flash的实际表现上。
有开发者在构建3D金门大桥场景时,反复提示了三次,模型仍持续忽略指令。最终输出质量甚至还不如5个月前发布的Gemini 3.1 Pro。
另一位开发者在Antigravity平台上测试后反馈,木头纹理质量更差,大理石缺乏功能性,在AI游戏测试中同样失利。
有用户给模型布置中等规模任务,两分钟就完成了,但结果被评价为“一个本地4B模型都能比它做得更好”。
还有人将矛头指向了性价比。
有评论指出,3.6 Flash虽然便宜,但在每个编码基准上都表现不佳。相比之下,Kimiink> K3和GLM 5.2等模型由资本规模远小于谷歌的实验室打造,却交出了更好的成绩。
月之暗面作为
更具体的数据来自Artificial Analysis的评分。
有用户注意到,3.6 Flash在该平台上的得分与3.5 Flash完全相同,但排在Meta Spark 1.1、GLM-5.2、GPT-5.6 Luna、Claude Sonnet 5、Grok 4.5和GPT-5.6 Terra之后。
特约编译金鹿对本文亦有贡献
本文来自“腾讯科技”,作者:晓静,编辑:徐青阳,36氪经授权发布。
发布时间:2026-07-22 08:03