NVIDIA · Developer 博客

预训练以想象,微调以行动:世界-行动模型的崛起

Pretrained to Imagine, Fine-Tuned to Act: The Rise of World-Action Models

二〇二六年六月十五日 · 英文原文

该文为不熟悉VLA(视觉-语言-动作模型)与WAM(世界-动作模型)的读者提供快速词汇表。VLA是一种机器人策略,基于预训练的VLM(视觉-语言模型)主干,从视觉观测和语言指令生成动作,代表有Pi-0和GR00T N1。WAM则从预训练的世界模型或视频出发构建策略。

为不熟悉VLA/WAM术语的读者准备的快速词汇表
VLA 视觉-语言-动作模型(Vision-Language-Action model):一种机器人策略,从预训练的VLM(视觉-语言模型)主干出发,将其适配为从视觉观测和语言指令生成动作。大规模VLM预训练是该方案的核心部分。参见Pi-0和GR00T N1。
WAM 世界-动作模型(World-Action Model):一种从预训练的世界模型或视频出发的策略…
来源

译自 NVIDIA · Developer 博客 · 录于 二〇二六年六月十五日