Hugging Face · Daily Papers

机器人策略学习的几何动作模型

Geometric Action Model for Robot Policy Learning

Jisang Han, Seonghu Jeon, Jaewoo Jung, René Zurbrügg, Honggyu An, Tifanny Portela, Marco Hutter, Marc Pollefeys 等 10 位
来自 ETH Zürich
二〇二六年六月十六日 · arXiv:2606.17046 · PDF · Code

通用型机器人策略必须遵循用户指令,同时推理物体、相机和机器人动作在三维物理世界中的交互方式。近期出现的视觉-语言-动作模型(VLA)和视频世界-动作模型(WAM)虽然继承了大规模基础模型强大的语义或时间先验,但其运作仍主要基于二维图像帧或二维导出的隐空间,未能显式表达接触密集型操作所需的三维几何结构。我们提出几何动作模型(GAM),这是一种语言条件化的操作策略,直接复用预训练的几何基础模型(GFM)作为感知、时间预测和动作解码的共享基底。GAM在GFM的中间层进行拆分:浅层作为观测编码器,在拆分层插入一个因果未来预测器,基于语言、本体感知和动作历史预测未来的隐层token。这些预测的未来token随后被送入剩余的GFM模块进行特征传播与解码,使得单一骨干网络能够同时生成未来几何结构与动作。该设计通过极小的架构改动,为GFM赋予了语言条件化的时间世界建模能力,同时保留了其丰富的几何先验。在涵盖仿真与真实机器人操作的广泛基准测试中,GAM相比当前基础模型规模的基线方法,在精度、鲁棒性、速度和轻量化方面均表现更优。

译自 Hugging Face · Daily Papers · arXiv:2606.17046 · 录于 二〇二六年六月十六日