

混元多模态团队最近动作不断,先是负责人离职、有人转岗,现在又传出xAI的蔺旭东空降加入。
听起来像内部调整,但你有没有想过:这背后的真正信号是什么?
腾讯好像正在悄悄从「内容生成」转向「理解+行动」这条新路线,而这一切,可能要追溯到一场路线之争。
公开资料显示,蔺旭东2018年毕业于清华,随后赴哥伦比亚大学攻读博士,研究方向涵盖嵌入学习、视频分析和生成模型。
毕业后他进入DeepMind,参与Gemini多模态预训练和后训练;2025年加入xAI负责多模态理解方向。如今空降腾讯混元,担任多模态内容生成算法负责人。
读博期间,蔺旭东参与了哥伦比亚大学和Facebook AI合作的Vx2Text项目。
这个项目的逻辑很巧妙:先把视频、声音等不同模态转换成类似「语言token」的向量,再统一送入语言模型融合,最后由自回归解码器生成开放式文本。
为什么这么麻烦?因为Transformer只认token,AI本质上根本不理解视频和音频这两种文件格式!
举个简单例子:一只狗跳进游泳池,视频识别器会输出「狗、跳跃、游泳池」,声音识别器会输出「水声、扑通」,然后模型把这些「翻译」成连贯的文本。
注意了!Vx2Text的产品功能是「生成」,但产品核心难点其实是「理解」。
模型不仅要识别人物、物体、动作和事件,还要理解这些东西在时间上的变化,最后才能组织成语言。
以前的生成模型像个「画面制造器」,给个提示词就能出图出视频。但只要要求复杂一点就拉胯:人物在长视频里变形、物体形状前后不一致、摄像机运动不符合空间逻辑……
这不是因为模型不会生成,而是因为它没有稳定地记住和理解世界!
把蔺旭东放到多模态内容生成的位置上,很可能就是因为他擅长把多模态「翻译」成AI能理解的东西。
混元多模态最核心的三个产品,就是HunyuanVideo、HunyuanImage和Hy 3D。
2024年12月首发即以130亿参数成为当时全球最大开源视频生成模型,支持5秒720p输出。2025年密集迭代:3月图生视频、5月定制化和数字人、11月1.5版本压缩至83亿参数。
2024年5月推出的首个中文原生DiT架构图像模型,2025年迭代出工业级实时生图的2.0版本,9月发布2.1(170亿参数、原生2K)和3.0(800亿参数)版本。
2025年7月,混元多模态迎来「四弟」Hy World 1.0——全球首个开源、支持仿真的沉浸式3D世界生成模型。
这背后是李飞飞的空间智能理论:AI要能感知、生成、推理并与三维空间中的世界互动。腾讯靠游戏引擎优势,硬是把这套设想做出来了!
在多模态这件事上,姚顺雨似乎更认同梁文锋。
梁文锋曾直言:「我们只做AGI主线——GPT、CoT、Agent。3D、视频生成、世界模型,跟智能主线没有太大关系。」
姚顺雨加入腾讯后的旗舰产品Hy3,把重点放在推理、智能体、长上下文和生产力任务上,而非多模态生成。
他还专门制作了CL-bench基准来测试模型的上下文理解能力,可见他对「在上下文中行动」的执着。
从组织架构看,腾讯已经撤销大语言模型部和多模态模型部,合并成立「基础模型部」。
这个动作本身就说明:多模态不再是独立的智能方向,而是要服务于主线模型的能力组件。
蔺旭东的加入,与其说是提升混元多模态生成性能,倒不如说是为了解决那个困扰所有多模态的问题——理解。
姚顺雨或许正是想学梁文锋,把混元现有的多模态基础,转换成为一种理解方式,进而更好地融合进主线模型。
一个大胆猜想:Hy提升多模态理解后,GUI Agent场景下的体验会更上一层楼。
GUI Agent的核心链路是「感知屏幕—理解界面—决策操作—执行验证」,多模态理解是连接视觉感知与语言决策的关键瓶颈。
至于这能不能证明李飞飞是错的?不一定。只能说——姚顺雨选择了梁文锋的路线,而蔺旭东,就是这场路线选择的一个注脚。
路子对不对,时间会给出答案,但敢于在巨人肩膀上重新选路的勇气,本身就值得点赞。
你觉得腾讯押注「理解+Agent」这条路线,跟字节、阿里比有胜算吗?评论区聊聊你的看法!觉得有启发的话,点个赞+转发给同样关注AI的朋友吧~