HiFi-UMI:仅从高保真UMI数据学习可部署操作策略
HiFi-UMI: Learning Deployable Manipulation Policies from High-Fidelity UMI Data Alone
学习可部署的操作策略受限于既高保真又可扩展的数据稀缺。真实机器人遥操作精确但扩展成本高昂;无机器人UMI采集易于扩展,当前实践主要将所得数据用于预训练,并在后训练阶段添加少量真实机器人"锚点"。我们探究:提升无机器人UMI数据的保真度,而非缩减真实机器人数据比例,能否消除这一锚点。为此提出HiFi-UMI,这是一套便携式UMI数据生产系统,协同设计轨迹精度、夹爪间相对位姿、同步性与视场角:头戴式离线立体惯性SLAM、原生而非重建的相对位姿、共享微秒级GPIO触发信号、每只手配备覆盖约200度的两个广角相机。该系统无需外部追踪基础设施即可达到3毫米工作空间末端执行器精度。利用该数据集,我们展示了零机器人后训练:仅基于HiFi-UMI演示数据后训练的策略可直接部署于真实机器人,并在涵盖视觉-语言-动作与世界-动作-模型两大族系的三个骨干网络上,与领域内遥操作性能持平——在StarVLA-QwenPI、OpenPI-pi_0.5和LingBot-VA上的成功率差异分别为-2.5、+3.1和-0.6个百分点;最强策略在精密插入任务上达到85%成功率,尽管遥操作基线在评估场景中采集且无任何HiFi-UMI轨迹。基于同一数据集进行4000小时预训练,使十个未见任务的动作误差降低41%,并在StarVLA-QwenPI上将真实机器人成功率进一步提升18.1个百分点。我们开源HiFi-UMI-2K——2000小时微秒同步、超宽视场角演示数据,每条数据均通过仿真回放自动重建与验证,为机器人学习社区提供大规模高保真资源。