当第四次工业革命进入深水区,数字化转型的最后一公里往往是物理世界的自动化。工厂里的机械臂、仓库中的AGV,乃至家政场景中的机器人,都在等待一种更“聪明”的学习方式——不再依赖工程师逐行编写代码,而是像人类一样“看一遍就会”。自变量机器人最新发布的HOST框架,恰好踩中了这个节点。它让机器人只需观看一段几十秒的人类视频,就能完成从任务观察到技能获取的全过程,并且不会遗忘此前掌握的技能。这听起来像科幻电影,但代码已经开源,论文挂在arXiv上,任何人都可以复现。

在数字化转型的宏大叙事中,机器人学习效率的提升意味着企业能够以更低的边际成本,将重复性劳动自动化。而HOST框架的出现,让“看一眼就会”不再是人类的专利,更可能成为下一代智能机器的标配能力。

从零样本到单样本:HOST如何打破机器人学习的“数据诅咒”

传统机器人学习依赖大量标注数据。一个简单的抓取动作,可能需要数千次示范才能让模型收敛。而HOST框架的核心创新在于“单样本技能获取”(One-Shot Skill Acquisition),它用一段29秒的人类视频作为输入,就能让机器人以62%的成功率复现技能。这个数字放在学术界或许不算惊艳,但如果对比基线——零样本方案仅45%的成功率,且需要大量微调——HOST的优势就格外明显。

更关键的是,HOST在数据效率上实现了数量级提升。相比Pi-0.5 + 微调方案,HOST所需数据量减少50倍,学习速度提升500倍。这意味着企业不再需要建设庞大的“示教数据库”,一台手机拍摄的人类操作视频,就能成为机器人的训练素材。对于正在进行企业数字化转型的中小企业来说,这无疑是降本增效的利器。

HOST的思路并非来自传统的强化学习或模仿学习,而是认知科学中的“观察学习”理论。人类面对陌生任务时,不会反复试错,而是先在大脑中模拟动作的预期效果,再执行。HOST将这种“想象-执行”机制移植到了机器人身上,让机器人先预测“做完会怎样”,再倒推出“该怎么做”。这种从“结果导向”出发的逆向推理,使得机器人在面对新任务时,无需改变底层模型参数,只需在推理时动态调整行为策略。

认知科学启示:为什么“想象”比“模仿”更高效?

模仿学习一直是机器人界的经典范式:让机器人看人类做动作,然后试图复制。但这种方法有个致命缺陷——机器人必须准确理解人类动作的意图,而人类和机器人的运动学参数、关节限制、力控特性完全不同,直接映射往往导致“东施效颦”。HOST采用了一种更聪明的做法:不去硬学人类动作序列,而是让机器人先想象“如果任务完成,画面应该是什么样”,然后自己规划出达到那个画面的动作。

这就像教一个不会做饭的人做番茄炒蛋。模仿学习是让他看厨师每一步的手部轨迹,然后照做;而HOST的方式是告诉他“最终你要得到一盘红黄相间的菜”,然后让他自己尝试切番茄、打鸡蛋、下锅翻炒。后者显然更符合人类的学习直觉。

自变量机器人的研发团队受到认知心理学中“心理模拟”概念的启发,将HOST的学习方案从“训练时微调循环”变为“推理时技能获取”。这意味着机器人在学习新技能时,不需要重新训练整个模型,而是在现有知识基础上,通过一次前向推理就完成技能迁移。这种机制与AI Agent技术中“推理时规划”的思路异曲同工,都强调了模型在先验知识上的泛化能力。

值得注意的是,HOST的“想象”能力建立在视觉预测模型之上。机器人先观看人类视频,将每一帧画面转化为潜在空间中的向量,然后通过一个“视觉大脑”预测出未来的状态图景。这个图景并非像素级的精确画面,而是语义层面的任务进度——比如“菜切好了”或“锅烧热了”。这种抽象层次的预测,使得机器人能够忽略不同人类演示中的个体差异(如手形、速度、背景),只关注任务本质。

任务进度对齐:解决机器人学习中的“时间错位”难题

机器人观看人类视频时,最头疼的问题不是“看不懂”,而是“对不上”。同一段视频,人类在第10秒打完鸡蛋,机器人可能在第10秒还在拿鸡蛋。如果仅按时间戳对齐,机器人就会丢失任务进度信息,导致动作错位。HOST的解决方案很巧妙:它不按时间对齐,而是按“任务进度”对齐。

具体来说,HOST将人类视频的每一帧和机器人操作的每一步,都映射到同一个向量空间里。这个向量空间隐式编码了“任务完成度”——比如从“拿起锅”到“倒油”再到“下菜”,每个子任务都有对应的进度标识。然后利用“动态时间规整”算法,自动寻找人类视频帧与机器人操作步之间的最佳匹配关系。这样一来,机器人执行到第N步时,看到的永远是人类视频中对应进度的那一帧,而不是时间轴上的固定帧。

这种对齐方式将时间误差降低了一个数量级。实验显示,机器人能够做到执行与视频示范的精准同步,哪怕人类演示的速度有快有慢,机器人也能自适应调整自己的节奏。对于AI技术在工业制造、家庭服务等场景中的落地,这种自适应能力至关重要——因为现实世界中,没有两个人类会以完全相同的速度做同一件事。

从更广阔的视角看,任务进度对齐也是一种“时序理解”能力的体现。最新科技中的多模态大模型(如GPT-4o、Gemini)虽然能理解视频内容,但很难直接输出机器人可控的动作序列。HOST通过将视频理解与机器人控制深度融合,打通了“看”与“做”之间的鸿沟。

双专家MoT架构:让视觉预测与动作执行各司其职

HOST的核心是一个带有视觉预测功能的级联策略模型,采用了双专家Mixture of Transformers(MoT)架构。这就像给机器人装了两个“大脑”:一个负责看,一个负责做。

“视觉专家”专门处理视频画面,定位任务进度,并预测未来的任务状态图景。它类似于一个视频压缩编码器,但目标是输出抽象的语义表示,而非像素重建。而“动作专家”则接收视觉专家的输出,将其转化为机器人需要执行的具体动作,如关节角度、末端执行器位姿、力控参数等。两个专家通过交叉注意力机制进行信息交互,但参数不共享,从而避免了“视觉任务”与“动作任务”之间的干扰。

这种解耦设计有一个显著优势:当机器人需要学习新技能时,只需更新视觉专家对任务进度的感知能力,而动作专家可以保持通用控制能力。换言之,动作专家学会了“如何控制机械臂”,视觉专家则学会“当前任务进行到哪一步”,两者组合就能应对新任务。这类似于人类大脑中背侧通路(负责空间定位)与腹侧通路(负责物体识别)的分工协作。

在工程实现上,HOST的MoT架构允许两个专家使用不同的Transformer层数和注意力头数,甚至可以用不同的预训练权重初始化。这种灵活性对于大模型训练成本控制很有帮助——企业可以复用开源的视觉骨干网络,只训练动作专家部分,大幅降低训练资源消耗。

两阶段训练:从同体到跨体的技能迁移路径

HOST的训练过程分为两个阶段:同体预训练和人机视频训练。这两个阶段的设计逻辑,与人类“先学会控制自己身体,再观察他人学习”的成长路径高度相似。

第一阶段是“同体预训练”。机器人通过观看自己执行任务的视频,学习预测完成任务后的状态,并生成对应动作。这个阶段的目标是让机器人建立“自身动作-结果状态”的映射关系。例如,机器人看到自己抓取一个杯子,然后杯子被拿起,它就能学会“抓取动作会导致杯子上升到某个高度”。这种自监督学习不需要任何人工标注,只需要机器人在环境中随机探索并记录动作-状态对。

第二阶段是“人机视频训练”。机器人观看人类演示视频,将人类执行任务的过程转化为机器人视角下的任务结果。注意,这里不是直接映射动作,而是映射“结果”。比如人类视频中有一只手把苹果从篮子里拿出来,机器人会推断:“如果最终结果是把苹果从篮子里拿出来,那我需要执行什么动作?” 然后它利用第一阶段学到的“自身动作-结果”映射,倒推出当前应该执行的动作序列。

这种两阶段设计使得技能迁移变得非常自然。机器人不需要理解人类手臂的关节角度,只需要理解“人类视频中任务状态的变化”,然后用自己的方式去实现同样的状态变化。这正是“单样本学习”的精髓:用一个样本(人类视频)提示目标状态,然后用自己的知识库完成动作规划。

目前,HOST的论文、代码、模型权重已经在GitHub和HuggingFace上完全开源。对于正在探索AI工具导航的开发者和企业来说,可以直接下载代码,在自己的机器人平台上复现实验。笔者已经看到不少机器人创业公司在GitHub上fork了该项目,试图将其集成到自家的服务机器人系统中。

开源生态与未来展望:家用机器人落地的最后一块拼图

HOST框架的开源,意味着机器人学习成本的断崖式下降。过去,一个家庭服务机器人要学习“打开冰箱门”,需要工程师花数天时间采集数据、训练模型、调试参数;现在,用户只需用手机拍摄一段自己打开冰箱门的视频,上传到机器人,机器人就能学会。如果这种模式普及,那么数字化转型将从企业级市场渗透到每个家庭——扫地机器人、烹饪机器人、护理机器人,都将拥有“看一眼就会”的学习能力。

当然,从实验室到真实场景还有距离。62%的成功率在工业场景中可能不够可靠,但考虑到这是单样本学习的首次尝试,提升空间巨大。随着更多研究者加入优化,成功率有望突破90%甚至更高。此外,HOST目前主要处理的是“短时任务”(如切菜、倒水),对于需要多步骤、长时序的复杂任务(如做一顿完整的饭),可能还需要结合记忆机制或分层规划。

但无论如何,HOST已经为机器人学习打开了一扇新的大门。它证明了“推理时技能获取”的可行性,也展示了认知科学对于AI技术发展的启发价值。在数字化转型的浪潮中,AI技术正在从“理解语言”走向“理解物理世界”,而HOST正是这一进程中的重要里程碑。未来,当我们看到机器人主动帮我们洗碗、叠衣服、照顾老人时,或许会想起这个可以让机器人“看视频学技能”的框架。

对了,如果你也想让手头的机器人变得更聪明,不妨试试用AI画图生成一些任务场景示意图,或者用抠图工具提取物体轮廓,辅助机器人的视觉识别。虽然这些工具不能直接训练机器人,但能帮助构建更丰富的训练数据。而对于想要快速体验AI魅力的朋友,AI诗词AI网名背后的大模型技术,本质上与HOST中的视觉预测模型同源,都是对“生成式AI”的巧妙运用。

最后,笔者想强调一点:HOST框架的开源,不仅是一次技术分享,更是一种生态宣言。在数字化转型的宏图中,单打独斗的时代已经结束,只有开放协作才能推动AI工具导航越来越完善,让最新科技真正惠及每一个人。