TurboVLA:RTX 4090上以32 Hz运行、VRAM低于1 GB的实时视觉-语言-动作模型
TurboVLA: Real-Time Vision-Language-Action Model at 32 Hz on an RTX 4090 with <1 GB VRAM
来自 H-EmbodVis
摘要
视觉-语言-动作(VLA)模型通常采用以LLM为中心的“视觉→语言→动作”路径,即先将视觉观测投影到大语言模型的表示空间,再解码为机器人动作。尽管这种方法有效,但每次策略调用都会产生大量的计算和内存开销。本文提出TurboVLA,一种新的VLA范式,将传统的“V→L→A”路径重构为直接的“V+L→A”映射。TurboVLA不再将大语言模型作为感知与动作之间的中央接口,而是独立编码视觉观测和语言指令,通过轻量级的双向视觉-语言交互直接交换信息,并使用紧凑的解码器预测连续动作块。这种简单设计直接从视觉和语言特征构建任务条件化表示,显著降低了VLA推理的计算和内存成本。在LIBERO上,TurboVLA仅用0.2B参数、31.2毫秒推理延迟和0.9 GB推理显存(在消费级RTX 4090上)就达到了97.7%的平均成功率,与或优于规模大得多的VLA策略。这些结果确立了TurboVLA作为当前以LLM为中心的VLA范式的简单有效替代方案,为如何连接视觉、语言和动作以实现高效机器人操作提供了新视角。代码已开源:https://github.com/H-EmbodVis/TurboVLA。
译自 Hugging Face · Daily Papers · arXiv:2607.27205 · 录于 二〇二六年七月三十日