在AI创业的浪潮中,具身智能赛道正成为资本追逐的新热点。成立于2025年初的眸深智能,凭借其独特的技术路线和豪华的创始团队,在短短两个月内连续获得近亿元Pre-A轮追加融资,估值增长超10倍。这家由复旦教授、前英特尔首席科学家创立的公司,试图为10亿台机器人装上“原生通用大脑”,其背后隐藏着怎样的技术密码和商业逻辑?本文将深入剖析。
从学术殿堂到创业战场:超级团队的“降维打击”
眸深智能的诞生,是学术智慧与产业经验的完美碰撞。公司由复旦大学深度学习实验室主任陈涛教授、原英特尔中国首席科学家张益民博士,以及连续创业者穆泽林共同创办。核心团队不仅拥有海思、英特尔、英伟达三大芯片巨头的背景,更具备国内少有的算子级适配能力——这种跨学科的组合在AI创业领域并不多见,但正是这种背景让他们在AI工具导航的赋能下,快速打通了技术到产品的路径。
2025年1月正式注册成立后,眸深智能迅速完成了3亿元Pre-A轮融资,随后又在两个月内获得近亿元追加融资,投资方包括中国头部物业服务公司、香港财团等联合打造的产业投资平台。值得注意的是,该公司Pre-A+轮的近5亿融资也在交割当中。这种融资节奏在当前的AI创业环境下堪称罕见,尤其是当大部分同行还在为生存挣扎时,眸深智能已经用业绩证明了自身价值:2025年审计回款收入达到千万元,2026年上半年更是突破3000万元,预计全年营收5000万元以上。
团队的技术积累远比公司成立时间更久远。从2022年起,他们就开始在动作生成领域深耕,先后发布了MLD、MotionGPT等开创性模型。这种“学术先行、产业落地”的打法,让眸深智能在成立之初就拥有了别人难以逾越的技术壁垒。
重新定义具身智能:动作世界模型的技术突围
在具身智能领域,大多数团队都在追随VLA(视觉-语言-动作)路线,而眸深智能选择了一条截然不同的路——以动作为核心的“世界动作模型”(World Motion Model)。这一技术路线的精髓在于,它不再将动作视为离散的信号,而是通过隐空间扩散模型让AI学会“无师自通”地生成连贯动作。就像AI画图工具通过扩散模型从噪声中生成图像,MLD(隐空间动作扩散模型)将动作映射到隐空间,让模型从随机噪声中还原出自然、连贯的人体姿态。
如果说MLD解决了“怎么生成动作”,那么MotionGPT则解决了“如何指挥动作”。2023年9月,团队创造性地将人体姿态拆解为约3000个“动作基元”,类比汉字的常用字。通过预测下一个“动作token”,机器人能够理解从未见过的动作指令——这就是Zero-Shot(零样本)泛化能力。这项发表于NeurIPS 2023的研究,是全球首个将动作做成token的具身大模型。
到了2026年,团队已经迭代到第7代模型,并推出了STI-WM(时空一体世界动作模型)。这一框架彻底摆脱了传统VLA对海量真机数据的依赖,实现了空间结构、时间演化、物理一致性、执行鲁棒性的四维统一。更令人惊叹的是,其训练配方为“80%互联网视频+10%动捕数据+10%真机数据”,将真机数据需求降低了90%,同时动作准确度提升至99%。
数据训练革命:80%互联网视频如何颠覆传统范式
传统具身智能的训练依赖昂贵的真机数据采集,一个简单的抓取动作可能需要数千次真实物理交互。而眸深智能的数据训练范式,堪称一场革命。他们从海量互联网视频(影视剧、监控、Vlog等)中学习物理规律,再用少量动捕数据校准生物力学特征,最后仅用10%的真机数据完成闭环对齐。这种数据使用方式类似文生图模型从海量文本中学习,但具身智能需要更复杂的物理一致性约束——比如“喝水时手会抬到嘴边”“抱胸后大概率会展开手臂”这种动作因果逻辑。
团队还引入了T²MB(Task*Task Motion Brain)机制,让机器人具备离线自进化能力。当模型部署到端侧后,无需联网回传数据,仅凭本地交互就能持续优化性能,任务执行准确度最高提升25%。这意味着机器人不再需要因为发现bug而返厂升级,大幅降低了落地成本。
值得注意的是,英伟达DAIR实验室在最新的ARDY模型中,直接援引了眸深智能的MLD与MotionGPT两项原创技术——这是近两年英伟达第三代动作模型第四次引用该公司的技术路线。这种来自顶尖科技公司的认可,无疑是对其技术路线的强有力背书。
端侧大脑的降本增效:从20万到1万的推理成本
真正决定具身大脑能否规模化的,除了技术路线,还有端侧算力成本。眸深智能从第一代模型起就同步推进两个方向:模型压缩与国产芯片适配。通过模型蒸馏、冗余参数压缩等工程化方案,他们将千亿参数级模型压缩至百亿级别,参数量降低约75%,端侧推理延迟从约200毫秒降至10毫秒左右。这一过程涉及复杂的大模型训练优化技术,该团队也凭借此项工作获得了IJCAI 2025全球最佳论文奖,成为近五年唯一获此奖项的中国大陆团队。
更令人振奋的是成本的变化:模型端侧推理成本从20万元降至1万元,大脑续航时间提升10倍,而精度和性能却丝毫不掉点。这种“软硬协同”的打法,让眸深智能可以在两周内完成一套具身大模型从一个本体到另一个本体的适配,包括复旦自研的“光华1号”、宇树G1、上海人形机器人创新中心的“青龙”和“灵龙”等本体。
对于正在推进企业数字化转型的物业、环卫、工业检测等场景,这种低成本、高实时的端侧大脑意味着可以大规模部署机器人,而无需担心高昂的算力成本。
国产算力路线:自主可控的战略选择
当大多数国内具身智能团队还在使用英伟达卡进行训练、再移植适配国产芯片时,眸深智能选择了一条更难但更具远见的道路:全流程基于国产算力芯片原生开发。团队拥有海思、英特尔、英伟达三大芯片巨头的背景,是国内唯一具备算子级适配能力的具身大模型团队。目前已经打通了燧原S60、昇腾310/910等国产芯片的部署,下半年目标是攻克千卡级国产集群训练。
这种选择并非技术偏执,而是基于长期战略判断。随着地缘政治风险加剧,英伟达卡越来越贵且供应受限,国产化是不可逆的趋势。更重要的是,通过算子优化,他们可以用更少的算力达到同样的效果——别人训练一次需要1万张卡、花费5亿,他们只需1000张卡、5000万就能完成,类似于DeepSeek的低成本训练逻辑。
在端侧具身芯片领域,目前国内已有20多家公司在布局,但大多瞄准200TOPS算力。而眸深智能认为,未来模型需要处理触觉、传感器、3D点云等多模态信号,算力需求会快速提升到1000-2000TOPS。他们不会自己做芯片,而是通过AI Agent技术的深度优化,与芯片公司合作而非重复造轮子。
商业化落地:从营收千万到千亿市场的想象空间
眸深智能是目前国内少数有营收的具身智能大脑公司。其客户覆盖工业检测、物业、环卫等场景,2026年第一季度已与某港股上市物业公司、A股上市环卫龙头的机器人产品交付,正在推进与头部连锁零售集团、头部白色家电工厂的人形机器人落地场景研发。
创始人穆泽林认为,未来产业分工中,本体可能会像汽车行业一样出现不同特色,但大脑领域大概率会形成“一超多强”格局。通用大脑的研发门槛极高,国内真正具备研发能力的团队屈指可数。眸深智能的目标是成为那个“超级通用大脑”,同时允许其他团队聚焦细分场景。
从技术到商业,眸深智能正在打通最后的闭环。随着AI工具导航等生态工具的完善,未来机器人将像智能手机一样,通过通用大脑实现各种技能的快速部署。万亿级的具身智能市场,正在为这家AI创业新星敞开大门。