MoMo:基于时空动作标记化的机器人操作动态模式
MoMo: Dial Motion Mode in Robot Manipulation with Spatiotemporal Action Tokenization
摘要
MoMo是一个两阶段模仿学习框架,包含时空动作分词器和行为克隆变换器,后者以任务和连续运动模式条件为输入。该框架旨在学习跨任务共享的可复用行为因素,使机器人根据任务、物体及交互环境调整动作展开方式。在六个真实机器人操作任务中,调整条件能产生稳定的执行变化,验证了执行层面变化可作为可复用行为因素进行学习。
要在多样化的情境中有效运作,机器人不仅需要精确执行操作任务,还需根据任务、物体及交互环境调整其动作展开方式。我们探讨这种执行层面的变化能否作为一种跨任务共享的可复用行为因素进行学习。为此,我们提出MoMo,一个两阶段模仿学习框架,包含时空动作分词器和一个行为克隆变换器,后者以任务和连续运动模式条件为输入。在六个真实机器人操作任务中,调整该条件能产生稳定的…
译自 Apple · ML Research · 录于 二〇二六年七月三十一日