当AI工具从虚拟世界走向物理空间,人形机器人不再是科幻电影中的幻想。近日,一家名为德塔智能(Delta Intelligence)的AI创业公司完成近5亿元天使++轮融资,投资方包括多家上市公司产业方和头部财务机构。成立仅半年,这家由UCLA博士团队创立的公司已累计完成六轮融资,背后站着智元机器人、乐聚机器人、高瓴创投、联想创投等产业与资本巨头。他们瞄准的,是一条充满技术挑战却极具想象力的赛道——原生通用人形机器人基础模型。

从实验室到真实场景:人形机器人基础模型为何需要“全身智能”?

传统的人形机器人往往在实验室的平整地面上如履平地,但一旦走出实验室,面对台阶、门槛、楼梯以及各种不规则地形,它们的表现往往不尽如人意。根源在于,大多数现有模型是基于二维视觉表征构建的,缺乏对真实物理空间的深度理解。当机器人需要同时完成移动、操作和平衡决策时,二维视觉的局限性被急剧放大:门把手距离判断失误、身体空间调整不当、长时序动作误差累积——这些看似微小的偏差,足以让机器人在真实场景中寸步难行。

德塔智能的创始团队认为,必须从底层重新定义人形机器人的认知架构。他们提出“全身智能”的概念,强调人形机器人的基础模型必须从一开始就为全身协同操作(Loco-Manipulation)而建,而非在现有框架上修修补补。这种理念与当前主流AI Agent技术的演进方向不谋而合——智能体需要具备对环境的完整感知与闭环控制能力。

三维世界引擎:打破二维视觉表征的认知瓶颈

为了消除二维视觉带来的结构性偏差,德塔智能构建了一套原生三维世界引擎。与行业常见的做法不同,这套引擎直接处理点云、高斯泼溅等三维场景表示,实现原生的三维理解、推理和未来环境状态推演。这意味着机器人不再依赖“猜深度”的算法,而是像人类一样,对空间中的几何关系、物体距离和运动轨迹拥有精确的认知。

举个例子,当机器人站在门前,二维视觉系统难以准确判断门把手距离、开门方向以及身体如何让位。而三维引擎可以实时重建全局场景,将门把手的三维坐标、手臂运动轨迹和身体重心偏移量一并纳入计算。这种能力在工业场景中尤为重要:在能源运维、户外巡检等复杂环境中,任何空间判断的模糊都可能导致安全风险。

值得注意的是,三维引擎的数据处理能力与AI画图等生成式工具背后的技术有共通之处——它们都需要对空间和纹理进行高精度建模。德塔智能的团队在跨领域技术融合上展现了独特的视角。

全身全景数据采集:让机器人学会“像人一样”与环境交互

精准的三维空间理解只是感知层的基础,机器人能否真正掌握全身协同操作,取决于训练数据的质量。目前市面上的多数数采方案仅能捕捉手部等局部动作,基于这类数据训练的模型难以理解攀爬梯具、推拉重型门等依赖全身协同的复杂任务。

德塔智能自研了一套全身全景数采设备,采用纯视觉采集架构,同步捕捉手、脚、腰、肩全维度人体骨架关节运动轨迹,同时基于第一视角视频流实时增量重建全局三维场景。单次采集可以输出两类核心数据:一是完整人体全身骨架数据,还原手脚协同、重心切换、借力操作等真实交互逻辑;二是高精度三维场景数据,记录障碍物、台阶、操作台面等环境物理参数。

这种采集方式本质上是在为AI工具提供“教科书级”的训练样本。在采集路径设计上,团队针对不同开发阶段规划了分层方案:搭载机器人本体的遥操作采集用于后期真机微调,而无需实体机器人的无本体动捕模式则适用于大规模积累通用全身交互样本。两种模式搭配使用,在数据规模、采集成本与精度之间实现平衡。

“人形机器人的学习逻辑应当对标人类,必须完整采集全身与环境的交互行为,才能搭建无认知偏差的世界模型。”德塔智能创始人兼CEO马晓健在访谈中强调。这与AI工具导航中关于数据采集效率的讨论不谋而合——高效的训练数据管道是AI工具落地的关键。

大小脑分层架构:高自由度本体的控制难题如何破解?

人形机器人拥有数十个联动关节,高自由度带来的是底层控制链路的指数级复杂度。此前常见做法是将规划模型输出的指令直接下发给底层控制器,这种方式在低自由度的机械臂上尚可,但在人形机器人身上,中间缺失的全身协同调节模块会导致动作卡顿、发力失控甚至失衡摔倒。

德塔智能搭建了“大脑+小脑+力位混合”三层原生协同架构。大脑模块搭载自研三维世界引擎,负责环境感知、长时序任务规划和高层交互意图输出;小脑是基于海量仿真强化学习训练的神经网络,将大脑的稀疏高层指令转化为数十至数百赫兹的全身电机精细控制信号,实时动态调整重心、协调四肢发力;最后经由力位混合层输出柔顺的控制信号。

这套架构的差异化价值在全尺寸人形、五指灵巧手等高自由度设备上充分释放。小脑依托全身全景交互数据持续迭代,可自适应适配各类复合全身任务。值得注意的是,大脑和小脑的训练数据来源完全不同:大脑依赖真实物理交互数据,因为仿真系统的接触建模能力不足,难以精准复刻柔性形变、滑动摩擦等多触点复合交互;而小脑的平衡控制依赖物理规则,仿真环境可以低成本供给无限试错样本。这种“数据分层”策略,体现了德塔智能对大模型训练本质的深刻理解。

生态协同:基础模型提供商如何连接硬件与上层应用?

马晓健判断,随着具身智能产业化加速,算法模型企业与硬件主机厂深度协同将成为主流发展模式。德塔智能已与智元、乐聚、星海图、宇树等头部人形机器人厂商建立长期合作,依托标准化的本体适配流程,实现模型在不同硬件平台间的快速迁移。

这种生态协同需要解决一个核心难题:各家双足人形本体的硬件参数、关节约束、动力学特性差异巨大,如何完成跨本体快速适配?德塔智能沉淀了一套标准化的四步流程:全身动捕数据采集、跨本体运动重定向、小脑仿真强化学习、大脑快速微调。其中,重定向算法基于多约束优化,既要保证所有关节运动值落在本体限位区间内,又要完整保留原始动作的核心发力逻辑。

“整套流程下来,我们不需要每换一个本体就重新采集大规模数据、从头训练整套系统,适配周期和硬件损耗成本都大幅降低。”马晓健表示。作为人形机器人生态中的基础模型提供方,德塔智能致力于成为连接硬件平台与上层应用的关键一环。这种定位与企业数字化转型中平台化服务商的角色类似——通过标准化接口降低行业门槛,推动整个产业的规模化落地。

融资背后的产业逻辑:AI创业公司如何撬动数亿资本?

成立半年内完成六轮融资,累计金额近5亿元,德塔智能的融资节奏在AI创业公司中堪称罕见。投资方阵容涵盖产业资本和财务机构,既有人形机器人主机厂,也有汽车、半导体领域资本。这种“产业+资本”的双重背书,反映出市场对具身智能赛道的高度期待。

从技术路径看,德塔智能选择了一条“全栈自研”的路线:从三维世界引擎到全身全景数采设备,从大小脑架构到跨本体适配流程,几乎覆盖了人形机器人基础模型的所有核心环节。这种重投入模式在早期需要大量资金支持,但也构建了较高的技术壁垒。相比之下,许多科技公司倾向于更轻量的算法集成,但可能面临可扩展性不足的问题。

“我们不是在做一个补齐性的工具,而是在定义下一代物理智能基础设施。”马晓健的这句话,或许能解释为什么资本愿意押注这种长周期、高风险的赛道。随着物理通用人工智能(Physical AGI)的愿景逐步清晰,德塔智能所代表的“AI工具”新范式,正在改写人形机器人产业的竞争规则。

未来,当AI网名艺术签名等轻量级AI工具已经融入日常生活,人形机器人基础模型这类重器级AI工具能否同样走进千家万户?答案或许就藏在德塔智能的全身协同模型中。