姚顺雨重整腾讯多模态路线:靠拢梁文锋,远离李飞飞
从“内容生成”
转向“理解上下文并在世界中行动”。
文 | 苗正
编辑 | 王靖
来源| 字母AI(ID:zimuaitech)
封面来源 | 公开资料
腾讯混元多模态团队又发生了一起人事变动。据媒体报道,曾负责xAI多模态理解负责人蔺旭东,已经离开xAI,加入腾讯混元,担任多模态内容生成算法负责人。
这则人事消息之所以值得关注,是因为它发生在混元多模态团队持续调整的背景下。
过去一段时间,混元内部陆续传出负责人离职、研究人员转岗和新成员加入的消息。
原多模态理解负责人胡瀚离职创业,田永龙等人加入腾讯,原有多模态团队的汇报关系也随着大语言模型部门和多模态模型部门的整合而发生变化。
但这是否意味着腾讯多模态团队正在“改朝换代”,目前还不能直接下结论。
公开信息能够确认的是,混元确实出现了人员流动和组织重组。 蔺旭东的加入传闻,更像是这场调整中的一个新信号:腾讯正在重新组合多模态理解和内容生成这两条路线。
那么问题来了,蔺旭东究竟是什么来头,他能为腾讯补上什么能力?以及腾讯的多模态路线是否正在从“生成内容”转向了姚顺雨更偏向的“理解上下文并在世界中行动”?
蔺旭东是什么来头
他加入腾讯后能做什么?
公开资料显示,蔺旭东2018年毕业于清华大学,随后赴哥伦比亚大学攻读博士。
在读博期间,他的研究方向包括嵌入学习、视频分析和生成模型,也曾参与哥伦比亚大学与Facebook AI合作的Vx2Text项目。
V指的是视频,x指的是未知数,可以是声音、语音甚至是环境音,2代表to,Text则代表字幕。它的逻辑是,先把视频、声音等不同模态转换成类似“语言token”的向量,再统一送入语言模型进行融合,最后由自回归解码器生成开放式文本。
Transformer只能理解token,所以AI本质上是不理解视频和音频这两种文件形式的,也就更不可能将其转换成文字。
举个例子,一只狗在游泳池旁边跳进水里,那么Vx2Text的视频识别器看(V)就会输出关键词:狗、跳跃、游泳池;声音识别器(x)就会输出:水声、扑通。
虽然Vx2Text的产品功能是“生成”,但产品的核心难点在于“理解”。
当然,Vx2Text并不是简单地把画面“翻译”成几句话而已。模型需要从视频里识别人物、物体、动作和事件,还要理解这些东西在时间上的变化,最后再把视觉信息组织成语言。
博士毕业后,蔺旭东进入DeepMind,参与Gemini相关的多模态预训练和后训练工作。2025年,他又加入xAI,公开资料称其负责多模态理解方向,并参与多模态内容理解与生成模型的训练。
如今他加入腾讯混元,将负责混元多模态内容生成算法。
蔺旭东的加入与其说是提升混元多模态生成的性能,倒不如说是为了解决一个困扰所有多模态的问题——理解。
以前的生成模型更像一个画面制造器。给它一句提示词,它可以生成一张图片、一段视频。但只要用户提出更复杂的要求,模型就有点跟不上了。比如人物在长视频里变了,物体的形状前后不一致,摄像机运动不符合空间关系等等。
这不是因为模型不会生成,而是因为它没有稳定地记住和理解世界。
所以,把蔺旭东放到多模态内容生成的位置上,可能正是因为他把多模态,“翻译”成AI能理解的东西。
蔺旭东的加入要放在一个更大的背景下才能看得清楚,那就是如今腾讯混元正在重新整理自己的多模态路线。
2025年1月,腾讯杰出科学家(Tencent Distinguished Scientist)胡瀚接替此前离职的刘威,全面负责混元多模态大模型的研发,同时担任腾讯混元大模型Tech Lead。
2025年下半年腾讯内部组织调整,他从多模态模型部,调入了大语言模型部旗下的“Frontier”前沿技术研究组,头衔变成了多模态理解方向负责人,汇报线也改为向姚顺雨汇报。
实际地位从“一个独立部门的领导”变成了“大语言模型部下面一个研究组里某个方向的负责人”,管的范围从整个多模态大模型收缩到只剩多模态理解这一块,多模态生成等方向被划出去了。
2026年3月腾讯已经撤销了成立近十年的AI Lab,部分人员并入混元大语言模型部转向姚顺雨汇报。在这次调整后,此前混元实际掌舵人、腾讯公司副总裁蒋杰,正式与姚顺雨完成工作交接,不再兼管AI Lab和混元。
2026年7月初,前OpenAI研究员、姚顺雨清华本科校友田永龙加入腾讯,负责视觉语言模型方向。
紧接着没过几天,腾讯TEG正式发文,撤销大语言模型部和多模态模型部,合并成立“基础模型部”,姚顺雨任负责人,向TEG总裁卢山汇报。腾讯称,此举旨在提升模型研发与协同效率,探索全模态模型的智能上限。
随后,胡瀚被曝离职创业。
前亚马逊首席科学家、京东数科首席科学家、阿里通义实验室应用视觉团队负责人、原腾讯多模态模型部负责人Linus在这次调整之后,从原本和姚顺雨平行的地位,改为了向姚顺雨汇报。
还没完,腾讯混元多模态基础模型负责人钟钊,负责HunyuanVideo和HunyuanImage两条生成线,是混元多模态生成方向的实际掌舵人。
他在8月14日发了一条朋友圈,称“即将发布的版本或将是我在HunyuanVideo与HunyuanImage项目中的最终版本”,字里行间充满了告别。
蔺旭东或许只是混元多模态换血中的一员,但是他的加入释放出了一个明显的信号,整个腾讯对于多模态的研发方向,已经发生了改变。