MiniCPM-机器人操控
MiniCPM-RobotManip
摘要
MiniCPM-RobotManip 是由 OpenBMB 发布的 1.5B 参数视觉-语言-动作(VLA)模型,用于具身操作任务。该模型采用统一权重策略,在代表性评估中优于 π₀.₅ 和 Qwen-VLA 等更大规模模型。通过流式推理将每步计算量从 125 TFLOPs 降至 3.3 TFLOPs,保留 60 帧历史并支持最长一分钟视觉记忆。继承 MiniCPM-V 4.6 的视觉 token 压缩能力,每帧从 256 压缩至 64 个 token,在 H100、BF16 条件下单帧前向延迟为 120 ms(π0.5 为 234 ms)。模型权重和代码基于 Apache-2.0 许可证开源,参考了 starVLA 和 LeRobot 项目。
MiniCPM-RobotManip 是一个 1.5B 参数的视觉-语言-动作模型,用于具身操作任务,具有以下亮点:
Benchmark 结果
推理示例
请确保 transformers==5.7.0
致谢
许可证
模型权重和代码在 Apache-2.0 许可证下开源。
译自 OpenBMB · HF · 录于 二〇二六年八月二十六日