文 | 周鑫雨
编辑 | 张雨忻
《智能涌现》独家获悉,近期,腾讯混元多模态理解负责人胡瀚提出了离职。
此前,他曾担任微软亚洲研究院视觉计算组首席研究员。2025 年初加入腾讯后,负责视觉大模型的研究。在后续的调整中,他加入大语言模型部旗下的“Frontier”前沿技术研究组,负责多模态理解的相关研究,汇报给姚顺雨。
据了解,胡瀚还曾承担世界模型的研发工作。
与此同时,腾讯大语言模型部负责人姚顺雨近期正在密集梳理旗下团队,胡瀚此前所在的研究组或将聚焦世界模型的前沿研究。
截至发稿,腾讯未对上述信息做回复。
自 2026 年年中以来,围绕混元体系的人员变动一直在进行。7 月初,前 OpenAI 研究院、麻省理工学院博士田永龙加入大语言模型部——我们得知,他将代替胡翰负责视觉语言模型方向(VLM)的研发,并汇报给姚顺雨。
自姚顺雨加入,补全短板、将混元基模的能力快速提升至第一梯队,就成了腾讯 AI 的主线。
重新梳理资源分配,将人才、算力聚焦至大语言模型部负责的基础模型研发,是姚顺雨上任后的核心举措之一。
比如,腾讯撤销 AI Lab 后,核心研发人员全部并入了大语言模型部。大语言模型人才的招聘力度也随着姚顺雨的加入而变大,比如来自字节 Seed Infra 团队和后训练团队的数人。
后来,在 6 月 5 日的腾讯云AI产业应用大会上,腾讯集团高级执行副总裁、云与智慧产业事业群 CEO 汤道生,某种程度上替外界向姚顺雨问出了一个尖锐的问题:很多人说腾讯在AI上慢了,你觉得我们真的慢了吗?
但其实,“顺雨比腾讯的高层更急。”一名混元的研究员告诉《智能涌现》。他提到,姚顺雨多次向腾讯高管为混元争取更多的算力资源。
另一个细节是,“晚点 LatePost”曾提到,在 Hy3 发布前的一个月,一批数据出现了问题。姚顺雨用少见地严厉措辞告诫了团队:“数据非常重要。如果下次再出现这样的情况,直接走人。”
当各条 AI 战线均未跑出领先身位时,腾讯想要突围,势必要重新衡量各个 AI 技术方向的收益。
一方面,胡瀚所从事的多模态理解研究已经趋于成熟,继续投入资源所带来的收益已经十分有限。
“在多模态理解研究中,文字、图像、视频识别准确率基本上能达到85%以上,”一名多模态研究员告诉我们,“难的其实是视觉推理,就是让模型理解图像和视频意味着什么,这一步靠多模态研究是不够的,而是要提升语言模型的推理能力。”
技术红利渐退,多模态理解所能带来的商业收益,也并不明晰。
此前,多模态研究一度在腾讯 AI 体系中占据核心地位。核心原因是,计算机视觉技术,可以直接与广告、游戏、影音这些“现金牛”业务强结合,为腾讯创收。
但相较于生成技术,多模态理解所对应的“识图”“看图写话”等场景,其实无法直接商业化。
“没有用户愿意为识图付费,市面上有大把免费可替代的产品。”一位元宝产品经理提到,用户真正愿意付费的,是文档处理、PPT制作、研报制作这些办公场景——背后对应的,是模型的推理、Coding、Agentic能力。
另一方面,腾讯的算力资源有限,与字节、阿里相比并不占据优势。
2025 年腾讯财报显示,腾讯全年资本开支为 792 亿元;相对的,截至 2026 年 3 月,阿里的财年资本开支达到了 1260 亿元;而据彭博社报道,2026年字节计划将 AI 基础设施投入最高推至 700 亿美元。
资源有限,混元内部难免陷入僧多粥少的局面。此时,暂缓技术红利有限的多模态理解研究,聚焦在更代表未来的前沿方向研究上,是腾讯权衡收益后的抉择。
7 月 6 日,姚顺雨交出了加入腾讯后的第一份正式答卷,大模型 Hy3。在同等参数量的中等尺寸模型中,Hy3已经能和GLM-5.2、
在腾讯 AI 自身的坐标系上,姚顺雨加入以来的组织重组、基建体系(数据、Infra、评测)重构,以及回归基模的战略,让混元在短短半年内,有了上 AI Tier 1 牌桌的资格。
(《智能涌现》作者李炤锋亦有贡献。)
发布时间:2026-07-23 17:12