在AI大模型竞赛进入深水区的当下,腾讯终于打出了一张“整合牌”。近日,腾讯宣布将混元多模态模型部门与大语言模型部门合并,成立基础模型部,统一由首席AI科学家姚顺雨管理。这一动作被业内视为腾讯在AI绘画、多模态交互及智能体领域加速落地的关键信号。合并后的团队将聚焦于探索全模态模型的智能上限,不再单纯追求单点突破,而是构建从语言到图像、视频、3D世界的完整能力闭环。
对于普通用户而言,这意味着未来使用腾讯系产品时,将能体验到更自然、更丰富的AI交互——无论是用一句话生成一张精密的AI绘画,还是用一段文字驱动一个3D场景,甚至让AI帮你写诗、设计签名,这些最新科技正在从实验室走向日常。而本次合并,正是为这些场景铺路的基础设施升级。
架构重组:从“双引擎”到“全模态”的必然选择
腾讯此次合并并非临时起意。回顾2025年底,腾讯曾大刀阔斧地升级大模型研发架构,新成立AI Infra部、AI Data部、数据计算平台部,构建起从底层算力到数据供应的完整体系。如今将大语言模型和多模态团队合二为一,本质上是把“大脑”和“感官”打通——大语言模型负责理解与推理,多模态模型负责感知与生成,二者融合才能产生真正的智能。
这种架构调整背后,反映的是AI行业对大模型训练范式的重新思考。过去,语言模型和图像/视频模型往往各自为战,训练数据、算法框架甚至团队文化都不同。但以GPT-4o、Gemini等模型为代表的最新科技表明,原生多模态训练能带来更高效的推理和更自然的交互。腾讯选择在这个时候合并,相当于主动拥抱了趋势。
姚顺雨将直接向腾讯总裁刘炽平汇报,同时兼任AI Infra部、大语言模型部负责人,向技术工程事业群总裁卢山汇报。这种双重汇报架构意味着,基础模型部不仅负责技术研发,还直接对业务落地和基建效率负责。腾讯希望通过减少部门墙,让AI Agent技术更快地从学术论文变成产品功能。
姚顺雨:从“推理-行动”到“全模态”的领航者
任命姚顺雨统领基础模型部,是腾讯这步棋中最具想象力的落子。这位本科毕业于清华大学姚班、普林斯顿大学博士、2024年加入OpenAI参与智能体产品Operator与Deep Research开发的顶级AI科学家,有着鲜明的学术标签——他提出的ReAct方法首创“推理-行动”结合的智能体范式,被学术界和工业界广泛采纳。
姚顺雨的研究核心是“语言智能体与现实世界交互”,这与腾讯当前对全模态模型的追求高度契合。在传统的AI系统中,模型只能“看”或“说”,但智能体需要同时具备理解、规划、执行和反馈能力。例如,当用户要求AI生成一张“赛博朋克风格的AI绘画”时,模型不仅要理解文字描述,还要知道如何调用图像生成模块、调整参数、甚至根据用户反馈迭代修改。这正是ReAct范式在生成任务上的延伸。
姚顺雨的加入,让腾讯在智能体技术路线上有了明确的学术带头人。他曾在OpenAI参与Operator(智能体产品)和Deep Research(深度研究工具)的开发,这些经验将直接反哺腾讯的AI工具导航生态。可以预见,未来腾讯的AI产品将不再只是“回答问题”,而是能主动执行任务,比如自动完成图片抠图、生成藏头诗、乃至设计艺术签名。
Hy3大模型:性能跃升与生态爆发
伴随架构调整,腾讯混元Hy3大模型的表现成为外界关注的焦点。据官方介绍,Hy3于7月正式上线,展现出显著强于同尺寸模型、且比肩参数规模2-5倍旗舰模型的智能水平。这一成绩在业界引起了不小震动——通常情况下,参数量是决定模型能力的关键,但Hy3用更小的参数实现了更大的效果,这意味着在架构设计、训练数据和算法优化上有了本质突破。
数据最能说明问题:发布一周后,Hy3总调用量较上一代模型Hy2增长超68倍。在WorkBuddy自选模型的用户中,选择Hy3的占比高达60%。这一爆发式增长不仅得益于模型本身的强大,也得益于腾讯系产品的全面接入——WorkBuddy、CodeBuddy、元宝、Marvis、ima等多个业务已经集成Hy3,API也已在腾讯云TokenHub以及多个海外平台上线。
这种“模型+应用”的闭环能力,正是腾讯区别于其他大模型厂商的独特优势。当用户使用文生图功能时,背后的Hy3模型能理解复杂的语义指令,再配合多模态模型生成高质量图像。而在企业级场景中,Hy3的推理能力可以支撑智能客服、代码辅助、文档分析等科技产品的日常运转。
多模态矩阵:从3D世界到AI绘画的全面突破
如果说Hy3是腾讯AI的“大脑”,那么多模态模型就是“五官和四肢”。腾讯混元构建了包括图像、视频、语音、3D生成在内的完整模型矩阵,其中多个模型已经达到行业领先水平。
混元3D世界模型2.0(HyWorld 2.0)于4月发布并开源,能够根据文字、图片、视频等不同类型输入,自动生成、重建和模拟3D世界。它支持多格式3D资产导出,可与现有游戏工作流无缝对接,快速生成游戏地图和关卡原型。这一能力对于游戏行业、虚拟现实、数字孪生等领域意义重大。目前,混元3D系列模型的社区下载量已超过300万。
在图像生成领域,混元图像模型3.0在LMArena榜单上位居国内开源模型第一。这意味着,在AI绘画这个竞争激烈的赛道上,腾讯已经站在了第一梯队。用户可以通过AI画图工具,用自然语言生成高精度、高审美的图像。更重要的是,这些模型都是开源的,开发者可以基于它们进行二次开发,构建自己的AI绘画应用。
此外,腾讯在AI绘画相关的工具链上也做了大量布局。比如,结合抠图和背景去除功能,AI绘画生成的图像可以直接用于电商、设计等领域;而透明背景的支持则让素材合成更加灵活。这些看似细小的功能,实际上构成了AI绘画从“玩具”到“生产力工具”的关键拼图。
行业影响:大模型竞赛进入“全模态”时代
腾讯这次合并,不仅仅是内部的组织调整,更是对整个AI行业走向的一次响亮表态。过去两年,大模型厂商主要围绕“语言模型”展开竞争,比的是参数量、推理速度和对话流畅度。但从2025年开始,行业共识逐渐转向:真正的通用人工智能必须同时处理语言、图像、视频、语音、3D等多种模态。
谷歌推出Gemini原生多模态模型,OpenAI发布GPT-4o(omni,全模态),Meta开源ImageBind……巨头们都在布局全模态。腾讯的合并动作,意味着它不再满足于“语言模型很强,多模态也不错”的局部优势,而是要通过组织协同,打造一个从底层训练到上层应用无缝衔接的全模态体系。
这种趋势对普通用户意味着什么?简单来说,未来的AI不再是“文本对话机器人”,而是能“看”能“听”能“画”能“动”的智能助理。你可以用语音描述一个场景,AI立刻生成对应的AI绘画;你可以上传一张照片,AI自动识别其中的物体并生成3D模型;你甚至可以用自然语言指挥AI规划一次旅行,它不仅能帮你查攻略,还能生成动态地图和景点示意图。
对于企业来说,企业数字化转型将迎来新的加速器。腾讯的AI能力通过云服务输出,企业可以快速调用图像识别、文字生成、语音合成、3D重建等能力,实现降本增效。而随着AI工具导航等平台的出现,个人开发者和小团队也能低门槛使用这些前沿技术。
未来展望:腾讯AI的下一站与实用工具生态
站在当前节点回看,腾讯AI的布局逻辑已经非常清晰:以基础模型部为技术核心,向上支撑各类应用产品,向下夯实算力与数据基础设施。姚顺雨的加入,让腾讯在智能体、推理-行动范式上的技术储备更加深厚。
接下来,我们可以期待几个方向的突破:
第一,全模态模型的深度融合。Hy3与多模态模型之间的协同将不再需要人工调度,而是通过统一的训练框架实现端到端优化。这意味着,用一句话生成一段包含AI绘画、背音乐和3D动画的完整视频,也许很快就能实现。
第二,AI Agent的规模化落地。姚顺雨提出的ReAct方法为智能体提供了理论框架,腾讯的产品矩阵(元宝、马维斯、WorkBuddy等)则为智能体提供了应用场景。未来,用户可能在一个对话界面中,让AI代理完成从信息检索到文件处理再到内容生成的全流程。
第三,开源生态的持续繁荣。混元3D模型、图像模型的开源策略已经吸引了大量社区开发者,未来腾讯可能会将更多能力开放,甚至推出AI工具箱,让开发者像搭积木一样组合不同模型。
不得不说,腾讯在AI绘画等创意工具上的动作看似低调,实则步步为营。从底层模型到上层应用,从技术开源到商业变现,一条完整的链路正在形成。对于用户而言,最好的消息是:这些最新科技将不再只是科技巨头的内测玩具,而是会真正变成日常使用的科技产品。
当然,挑战依然存在。全模态模型的训练成本极高,数据获取和隐私保护也是难题。但至少从腾讯的这次合并来看,决心已经摆在了桌面上——它要做的,不是跟随者,而是定义者。