找工位
空间入驻
小程序

腾讯多模态大换血!xAI蔺旭东空降,背后隐藏着一场路线之争

2026-08-19 14:02:11

混元多模态团队最近动作不断,先是负责人离职、有人转岗,现在又传出xAI的蔺旭东空降加入。

听起来像内部调整,但你有没有想过:这背后的真正信号是什么?

腾讯好像正在悄悄从「内容生成」转向「理解+行动」这条新路线,而这一切,可能要追溯到一场路线之争。

📌 蔺旭东是谁?他能为腾讯补上什么能力?

公开资料显示,蔺旭东2018年毕业于清华,随后赴哥伦比亚大学攻读博士,研究方向涵盖嵌入学习、视频分析和生成模型。

毕业后他进入DeepMind,参与Gemini多模态预训练和后训练;2025年加入xAI负责多模态理解方向。如今空降腾讯混元,担任多模态内容生成算法负责人。

🎯 他的核心武器:把「多模态」翻译给AI听

读博期间,蔺旭东参与了哥伦比亚大学和Facebook AI合作的Vx2Text项目。

这个项目的逻辑很巧妙:先把视频、声音等不同模态转换成类似「语言token」的向量,再统一送入语言模型融合,最后由自回归解码器生成开放式文本。

为什么这么麻烦?因为Transformer只认token,AI本质上根本不理解视频和音频这两种文件格式!

举个简单例子:一只狗跳进游泳池,视频识别器会输出「狗、跳跃、游泳池」,声音识别器会输出「水声、扑通」,然后模型把这些「翻译」成连贯的文本。

⚠️ 看似是「生成」,实则是「理解」

注意了!Vx2Text的产品功能是「生成」,但产品核心难点其实是「理解」。

模型不仅要识别人物、物体、动作和事件,还要理解这些东西在时间上的变化,最后才能组织成语言。

以前的生成模型像个「画面制造器」,给个提示词就能出图出视频。但只要要求复杂一点就拉胯:人物在长视频里变形、物体形状前后不一致、摄像机运动不符合空间逻辑……

这不是因为模型不会生成,而是因为它没有稳定地记住和理解世界!

把蔺旭东放到多模态内容生成的位置上,很可能就是因为他擅长把多模态「翻译」成AI能理解的东西。

📚 在此之前,腾讯是怎么做多模态的?

混元多模态最核心的三个产品,就是HunyuanVideo、HunyuanImage和Hy 3D。

🎬 HunyuanVideo:视频生成矩阵

2024年12月首发即以130亿参数成为当时全球最大开源视频生成模型,支持5秒720p输出。2025年密集迭代:3月图生视频、5月定制化和数字人、11月1.5版本压缩至83亿参数。

🖼️ HunyuanImage:中文原生DiT

2024年5月推出的首个中文原生DiT架构图像模型,2025年迭代出工业级实时生图的2.0版本,9月发布2.1(170亿参数、原生2K)和3.0(800亿参数)版本。

🧊 不止三个!Hy World来了

2025年7月,混元多模态迎来「四弟」Hy World 1.0——全球首个开源、支持仿真的沉浸式3D世界生成模型。

这背后是李飞飞的空间智能理论:AI要能感知、生成、推理并与三维空间中的世界互动。腾讯靠游戏引擎优势,硬是把这套设想做出来了!

💡 但姚顺雨并不同意李飞飞

在多模态这件事上,姚顺雨似乎更认同梁文锋。

梁文锋曾直言:「我们只做AGI主线——GPT、CoT、Agent。3D、视频生成、世界模型,跟智能主线没有太大关系。」

姚顺雨加入腾讯后的旗舰产品Hy3,把重点放在推理、智能体、长上下文和生产力任务上,而非多模态生成。

他还专门制作了CL-bench基准来测试模型的上下文理解能力,可见他对「在上下文中行动」的执着。

🔄 这场换血,释放了什么信号?

🔄 两条路线的整合

从组织架构看,腾讯已经撤销大语言模型部和多模态模型部,合并成立「基础模型部」。

这个动作本身就说明:多模态不再是独立的智能方向,而是要服务于主线模型的能力组件。

🚀 从「生成内容」到「理解世界」

蔺旭东的加入,与其说是提升混元多模态生成性能,倒不如说是为了解决那个困扰所有多模态的问题——理解。

姚顺雨或许正是想学梁文锋,把混元现有的多模态基础,转换成为一种理解方式,进而更好地融合进主线模型。

🧠 未来:GUI Agent的想象空间

一个大胆猜想:Hy提升多模态理解后,GUI Agent场景下的体验会更上一层楼。

GUI Agent的核心链路是「感知屏幕—理解界面—决策操作—执行验证」,多模态理解是连接视觉感知与语言决策的关键瓶颈。

至于这能不能证明李飞飞是错的?不一定。只能说——姚顺雨选择了梁文锋的路线,而蔺旭东,就是这场路线选择的一个注脚。

路子对不对,时间会给出答案,但敢于在巨人肩膀上重新选路的勇气,本身就值得点赞。

你觉得腾讯押注「理解+Agent」这条路线,跟字节、阿里比有胜算吗?评论区聊聊你的看法!觉得有启发的话,点个赞+转发给同样关注AI的朋友吧~