谷歌Gemini跌出全球排名前十

图片来源:界面图库 匡达

当地时间7月21日,谷歌旗下DeepMind对外推出三款全新Gemini轻量化模型,包含 Gemini 3.6 Flash、Gemini 3.5 Flash-Lite 以及行业专用模型 Gemini 3.5 Flash Cyber,但市场期待已久的旗舰版本Gemini 3.5 Pro 没有如期亮相。

据第三方评测榜单数据,谷歌当前主力Gemini系列综合实力已经跌至全球榜单十名以外,在头部大模型竞速赛道中显现压力。

据官方披露信息,三款新模型定位清晰,主要面向规模化商用场景。Gemini 3.6 Flash 作为通用主力轻量模型,优化多模态理解、工具调用与代码生成能力,在降低 Token 消耗的同时下调调用定价,适配智能体运行、批量文档处理等高频场景;Gemini 3.5 Flash-Lite 主打超高吞吐与低成本,面向高并发文本摘要、信息预处理、实时翻译等对延迟敏感的业务;Gemini 3.5 Flash Cyber 为网络安全专项模型,针对漏洞挖掘、代码安全检测完成定向微调,现阶段仅对限定机构开放试点,暂不全面公开发布。

今年谷歌 I/O 开发者大会上,谷歌首席执行官桑达尔·皮查伊曾在主题演讲中表示,Gemini 3.5 Pro计划于6月发布。这款旗舰模型被外界视作谷歌扭转高端市场劣势的核心产品,市场普遍预期其将在夏季正式亮相,对标 OpenAI、Anthropic 同期高端模型。

然而两个多月过去,谷歌依旧未能给出明确上线时间表,仅对外透露模型仍处在封闭合作伙伴测试阶段。旗舰机型持续跳票,也让行业开始审视谷歌在前沿通用大模型研发层面面临的瓶颈。

第三方评测平台最新排行榜展现出谷歌当前的窘境,主力Gemini型号综合评分已经落到榜单第十名之后。

据AI模型评测平台Arena.ai数据显示,Gemini 3.6 Flash 在前端代码竞技场中以1537分排名第12位。国内月之暗面最新发布的Kimiink> K3以1677分位列榜首,智谱GLM-5.2位列第四,Anthropic的Claude和OpenAI的GPT的多款系列产品位居前列。

Artificial Analysis最新智能指数排行榜中,谷歌目前没有任何一款模型进入前十,这与去年Gemini的情况大相径庭。去年11月,谷歌发布Gemini 3模型,曾反超OpenAI,测评引起业界震动,谷歌公司的股价也一路飙升。

但进入2026年,全球头部大模型赛道竞争愈发白热化,OpenAI持续迭代 GPT 高端版本,不断夯实复杂推理、多模态能力;Anthropic持续更新 Claude 系列,凭借长文本、安全性优势收获大量企业客户;与此同时,Meta、深度求索、月之暗面等国内外厂商持续推出新一代高性能基座模型,不断向上挤压排名空间。

7月17日凌晨,月之暗面正式发布新一代大模型ink data-id="14559" data-name="Kimi" data-logo="https://img.36dianping.com/20250909/v2_09edc0feda5a46f2a0a6ee30f817ad5c_oswg7004oswg64oswg64_img_000" data-classify-list="文本生成,摘要总结,智能搜索" data-refer-type="20">Kimiink> K3。该模型参数规模达2.8万亿,拥有100万token上下文窗口,原生支持视觉理解。月之暗面称其为“迄今能力最强的模型”。

特斯拉CEO马斯克在相关评测报道下留言“令人印象深刻(Impressive)”表达赞赏。随后,马斯克便在社交平台宣布,旗下AI公司正在训练的2万亿参数新模型,且“可能超越ink data-id="14559" data-name="Kimi" data-logo="https://img.36dianping.com/20250909/v2_09edc0feda5a46f2a0a6ee30f817ad5c_oswg7004oswg64oswg64_img_000" data-classify-list="文本生成,摘要总结,智能搜索" data-refer-type="20">Kimiink>”。

多组横向盲测数据显示,现有Gemini主力版本在复杂逻辑推演、长链条任务规划、复杂图文联合推理等高难度任务上,与第一梯队模型形成可见差距。部分评测机构指出,谷歌过往依靠先发优势建立的多模态领先优势正在被持续追赶、赶超。

竞争对手不断缩小多模态能力差距,而谷歌迟迟没有新一代旗舰产品补齐性能上限缺口。本次推出的三款新品均属于轻量化路线,优势集中在推理速度与使用成本,综合基础智能提升幅度有限。

市场调研人士分析,榜单排名滑落背后,竞品普遍维持稳定的高端旗舰迭代节奏,形成 “旗舰开拓性能上限、轻量化版本承接商业化落地” 的成熟布局。反观谷歌,中端Flash系列持续更新,但高端旗舰长期缺位,或将持续侵蚀谷歌在高端企业服务市场的话语权。

不过也有分析认为,从商业角度看,谷歌的策略更节省成本。更多的公司都开始重视AI投入产出比,大量消耗token并不总是带来最好的结果。谷歌CEO桑达尔·皮查伊则表示,如果混合使用Flash模型和其他前沿模型,能节省大量资金。

和竞争对手相比,谷歌拥有Android、Chrome、Workspace、搜索、云服务等形成的产品生态。在产品上不断压低成本、提高速度,同时增强模型处理具体任务的能力,而不是单纯追逐模型能力和榜单。

不过,谷歌母公司Alphabet近期在AI领域的大手笔投入并没有减少。据公开财报与投资者沟通信息,Alphabet将2026年全年资本开支上调至1800亿至1900亿美元,规模接近前一年两倍,绝大多数资金流向AI算力集群、数据中心扩建与自研芯片研发。一季度公司资本开支达到357亿美元,同比增幅超过 100%。

与此同时,谷歌DeepMind持续扩充前沿研究团队,吸纳人工智能领域顶尖人才,并且正式启动下一代 Gemini 4 基座模型的预训练工作。

本文来自微信公众号“界面新闻”,作者:沈霄戈,36氪经授权发布。

发布时间:2026-07-22 20:00