EnvHarness:唤醒静态世界以促进智能体学习
EnvHarness: Awakening Static Worlds for Agent Learning
来自 Google
摘要
LLM智能体通过与环境的交互进行学习,然而这些环境往往是手工构建且静态的:它们对智能体的弱点视而不见,并随着智能体的进步而迅速被超越。尽管近期的环境生成方法试图解决这一问题,但它们依赖特定领域的流水线、需要昂贵或不可靠的验证器,并且仍生成静态环境。为减轻从零重建环境的工程负担,我们提出环境套件(EnvHarness),一个可编程的插件组件层,它包裹静态环境以重塑其行为,而无需修改底层逻辑。通过标准接口运作,EnvHarness适用于多种领域,同时确保每个重塑后的环境保留其原始验证器。为自动化这一过程,我们引入EnvRigger,它将目标策略视为黑盒,观察其执行轨迹以合成针对已诊断缺陷的EnvHarness组件,并通过全新回滚进行验证。在四个领域的五个基准测试中,EnvHarness优于原始环境和特定领域的环境生成流水线,在保留实例上实现了高达9.0分的提升,同时执行步骤减少了9.8%。此外,EnvHarness为强化学习提供了更优的优化信号,使策略与其环境能够持续、有针对性地共同进化。
译自 Hugging Face · Daily Papers · arXiv:2608.19880 · 录于 二〇二六年八月二十一日