Qwen-AgentWorld:面向通用智能体的语言世界模型
Qwen-AgentWorld: Language World Models for General Agents
来自 Qwen
摘要
世界模型根据当前观测和动作预测环境动态,是推理与规划的核心认知机制。本研究探讨基于语言模型的世界建模如何进一步拓展通用智能体的边界。(i)首先聚焦构建智能体环境模拟的基础模型。我们推出Qwen-AgentWorld-35B-A3B和Qwen-AgentWorld-397B-A17B,这是首批能够通过长思维链推理模拟覆盖7个领域智能体环境的语言世界模型。利用真实环境中7个领域超过1000万条交互轨迹,我们通过三阶段训练流程开发Qwen-AgentWorld:CPT阶段从状态转移动力学和增强专业语料注入通用世界建模能力,SFT阶段激活下一状态预测推理,SFT阶段通过定制化框架结合混合评分规则与硬性奖励提升模拟保真度。为评估语言世界模型,我们提出AgentWorldBench——基于5个前沿模型在9个成熟基准上的真实交互构建的综合基准。实验结果表明Qwen-AgentWorld显著优于现有前沿模型。(ii)在基础模型之外,我们进一步探索世界模型增强通用智能体的两种互补范式。首先,作为解耦的环境模拟器,Qwen-AgentWorld支持对数千个真实环境进行可扩展、可控的模拟以用于智能体强化学习,其效果超越单纯的真实环境训练。其次,作为统一的智能体基础模型,世界模型训练可作为高效预热方法,提升7个智能体基准的下游性能。代码:https://github.com/QwenLM/Qwen-AgentWorld
译自 Hugging Face · Daily Papers · arXiv:2606.24597 · 录于 二〇二六年六月二十四日