在AI行业竞速白热化的2026年,腾讯混元体系再次迎来关键人事变动。据多方信源透露,混元多模态理解负责人胡瀚已于近期离职,这位曾任职微软亚洲研究院视觉计算组首席研究员的技术专家,在加入腾讯仅一年半后选择了新的创业征程。与此同时,腾讯大语言模型部负责人姚顺雨正加速重组团队,原多模态研究组或将全面转向世界模型的前沿探索。在科技前沿的这场人才与战略的双重洗牌中,腾讯AI的天平正在向何方倾斜?本文将结合内部视角与行业趋势,深度剖析这一事件背后的逻辑。

胡瀚离职:从微软到腾讯,多模态专家的转身

胡瀚的职业生涯堪称AI视觉领域的标杆。在微软亚洲研究院期间,他主导了多项视觉基础模型的研究,并在计算机视觉顶会发表数十篇论文。2025年初加入腾讯后,他最初负责视觉大模型研发,随后调入大语言模型部的“Frontier”前沿技术研究组,接管多模态理解方向,直接向姚顺雨汇报。值得注意的是,胡瀚还曾承担世界模型的早期研发工作——这或许是他离职后创业方向的重要线索。

知情人士透露,胡瀚的离职并非突然之举。在2026年7月初,前OpenAI研究院、麻省理工学院博士田永龙已加入腾讯大语言模型部,接替胡瀚负责视觉语言模型(VLM)研发。这一人事安排暗示着腾讯内部早已启动多模态团队的重组。胡瀚作为一名技术型管理者,在腾讯体系内或许感受到了资源分配与战略重心转移带来的压力。他的创业方向很可能聚焦于AI Agent或具身智能——这些领域与多模态理解有天然联系,且商业化路径更为清晰。

事实上,胡瀚的离职也是腾讯AI人才流动的一个缩影。自姚顺雨2025年底加入腾讯以来,大语言模型部的招聘力度显著加大,字节Seed Infra团队、后训练团队的多位核心成员接连加盟。与此同时,AI Lab被撤销后,其研发人员也尽数并入大语言模型部。这种“收拢五指”的做法,使得非核心研究方向的人才自然流向外部。对于胡瀚而言,选择创业既是对个人技术积累的变现,也是对腾讯战略调整的被动回应。

姚顺雨的铁腕重整:资源向基模倾斜,多模态理解让路

姚顺雨加入腾讯后的首要任务,就是补全混元基模的短板,将其能力推至第一梯队。这位在AI领域以“激进”著称的负责人,上任后迅速梳理了混元内部的资源分配。在腾讯的一次内部会议上,姚顺雨曾直言:“如果各条线都撒胡椒面,我们永远追不上对手。”这句话直接催生了后来的组织重组:将人才、算力集中到大语言模型部负责的基础模型研发上。

一个细节可以佐证姚顺雨的决心。在Hy3发布前一个月,一批训练数据出现问题,姚顺雨用少见的严厉措辞告诫团队:“数据非常重要。如果下次再出现这样的情况,直接走人。”这种对数据质量的极致要求,反映出他对基模能力提升的紧迫感。而多模态理解研究,恰恰在数据质量要求上相对宽松——识别准确率已达85%以上,继续投入边际收益递减。

在姚顺雨看来,多模态理解技术已经进入“成熟期”,继续投入大量资源的意义有限。一位混元研究员向记者表示:“多模态理解中,文字、图像、视频识别准确率基本达标,真正的难点是视觉推理——让模型理解图像和视频背后的含义。这需要提升语言模型的推理能力,而非多模态理解本身。”这意味着,腾讯选择将多模态理解“降级”,转而将资源投向更代表未来的世界模型和基模能力,本质上是战略收益的再权衡。

多模态理解的收益困境:技术成熟背后的商业化难题

多模态理解技术一度在腾讯AI体系中占据核心地位,原因在于计算机视觉可以直接与广告、游戏、影音等“现金牛”业务结合。但进入2026年,这一技术的商业化天花板逐渐显现。与生成式AI不同,多模态理解对应的“识图”“看图写话”等场景,很难直接转化为付费产品。

“没有用户愿意为识图付费,市面上有大把免费可替代的产品。”一位腾讯元宝产品经理透露。用户真正愿意买单的,是文档处理、PPT制作、研报分析等办公场景——这些背后对应的是模型的推理、Coding和Agentic能力。换言之,多模态理解更像是“基础设施”,而非“杀手级应用”。在AI融资收紧的大背景下,科技公司开始更审慎地评估每个技术方向的投入产出比。对于腾讯而言,与其在成熟技术上继续堆算力,不如将资源投向更具想象力的前沿领域。

有趣的是,多模态生成技术(如AI画图、文生视频)反而保持了较高的商业热度。用户愿意为AI生成的图片、视频付费,尤其是在广告素材创作、短视频制作等场景。这与多模态理解的“识别”逻辑截然不同。一位行业分析师指出:“理解是‘看’,生成是‘做’。前者容易被开源模型替代,后者则因为创意属性而具备溢价空间。”这也解释了为什么腾讯在调整中保留了多模态生成团队,而将理解团队剥离。

算力竞赛:腾讯的短板与取舍之道

在AI行业的军备竞赛中,算力是决定胜负的关键变量。2025年腾讯财报显示,全年资本开支为792亿元;而阿里截至2026年3月的财年资本开支达1260亿元;字节2026年更是计划将AI基础设施投入推至700亿美元(约合5000亿元人民币)。相比之下,腾讯的算力投入明显处于劣势。

资源有限,混元内部难免陷入“僧多粥少”的局面。在姚顺雨主导下,腾讯选择将有限的算力集中到基模训练和世界模型研发上,而暂缓多模态理解等收益递减的方向。这一决策与当年Google“砍掉边缘业务、聚焦搜索和AI”的策略如出一辙。在科技前沿的竞争中,聚焦往往比广撒网更有效。

值得注意的是,腾讯的算力短板并非没有补救空间。通过自研芯片(如紫霄系列)和优化训练框架,腾讯在同等算力下实现了更高的利用率。此外,混元团队还通过“数据蒸馏”和“小模型提炼”等技术,降低了对大规模算力的依赖。但长远来看,算力仍是制约腾讯AI登顶Tier 1的最大障碍。姚顺雨多次向腾讯高管争取更多算力资源,甚至不惜与内部其他业务部门“抢食”,这种紧迫感正是源于对算力差距的清醒认知。

Hy3亮相:腾讯AI的“回血”之战与未来展望

2026年7月6日,姚顺雨交出了加入腾讯后的首份正式答卷——大模型Hy3。在同等参数量的中等尺寸模型中,Hy3已经能与GLM-5.2、DeepSeek V4 Pro掰手腕。这一成绩的背后,是姚顺雨团队在数据、基础设施、评测体系等方面的系统重构。

Hy3的发布标志着腾讯AI在“基模能力”上重返第一梯队,但这只是开始。姚顺雨的目标远不止于此:世界模型正在成为混元新的核心方向。所谓世界模型,是能够理解物理世界运行规律、进行空间推理和因果推断的AI系统,被视为通往通用人工智能的关键路径。胡瀚此前承担的研发工作,恰好为腾讯积累了世界模型的早期经验。

对于腾讯而言,世界模型的研究需要与游戏、自动驾驶、机器人等业务深度结合。例如,在游戏场景中,世界模型可以生成更逼真的虚拟环境;在机器人领域,它可以帮助AI理解物理交互。这些应用场景与腾讯的生态高度契合,也是其区别于其他科技公司的独特优势。

然而,世界模型的研究仍处于早期阶段,技术风险高、投入大。腾讯能否在算力有限的情况下弯道超车?答案或许取决于姚顺雨能否继续争取到足够资源,以及胡瀚离职后留下的技术缺口能否被迅速填补。值得注意的是,在AI融资市场仍然活跃的当下,胡瀚的创业项目很可能获得资本青睐——这或许会反向推动腾讯加速布局AI Agent技术大模型训练等前沿赛道。

结语:腾讯AI的十字路口

胡瀚的离职既是个人职业选择,也是腾讯AI战略转型的必然结果。当多模态理解的技术红利渐退,姚顺雨选择将赌注押在基模能力和世界模型上,这无疑是一场豪赌。在科技前沿的竞争中,腾讯既需要“做减法”的勇气,也需要“做加法”的精准。

对于普通用户而言,这场战略调整的直接影响可能是:腾讯元宝等产品中的多模态理解功能会逐渐弱化,而文档处理、代码生成、Agent能力将显著增强。同时,AI画图文生图等生成式工具可能会迎来更大力度的资源投入。在AI工具泛滥的今天,用户不妨试试AI工具导航,这些产品正在成为办公效率的新标杆。

从更宏观的视角看,腾讯的案例给所有科技公司提供了一个启示:在AI浪潮中,没有哪家公司能面面俱到。聚焦核心能力、果断放弃边际收益递减的方向,才是穿越周期的正确姿势。而胡瀚的创业故事,或许才刚刚开始。