Hugging Face · Daily Papers

Agentic ESOpt:以极低GPU需求微调长程LLM智能体

Agentic ESOpt: Fine-Tuning Long-Horizon LLM Agents with Minimal GPU Requirements

Zhi Zheng, Rongsheng Chen, Yunpeng Ba, Zhenkun Wang, Yee Whye Teh, Wee Sun Lee
来自 National University of Singapore
二〇二六年八月十九日 · arXiv:2608.17310 · PDF · Code

强化学习(RL)在单轮大语言模型微调中已展现出潜力。然而,长程智能体推理引入了日益分支化的交互和稀疏奖励,暴露了RL的若干局限:其基于反向传播的重型训练栈使得微调更大规模的大语言模型不切实际,且更长轨迹使RL中的信用分配变得显著更困难。本文认为,进化策略(ES)可能是微调长程大语言模型智能体的更优选择。与智能体RL相比,ES具有三个关键优势:1)模型可扩展性:ES仅需极少的推理级GPU内存即可实现全参数优化,使得微调大型大语言模型成为可能;2)灵活性:其轻量级、黑盒反馈接口使ES微调易于与提示空间进化(如技能优化和测试时计算)组合;3)长程可扩展性:ES在轨迹层面进行参数归因,无需跨时间范围分解奖励,随着轨迹长度增长,其可扩展性优于智能体RL。基于这一洞察,我们提出Agentic ESOpt,一个专为灵活的参数-上下文协同进化而设计的全参数智能体微调框架。在每一步中,Agentic ESOpt在当前大语言模型参数周围采样扰动,用奖励评估所得智能体,并应用在线奖励加权更新。为改善探索-适应权衡,Agentic ESOpt进一步引入扰动尺度σ的余弦衰减调度。在WebArena-Lite上,对Qwen-3.5-27B进行全参数优化将No Skill基线提升了6.69%。在测试时自动启发式设计中,Agentic ESOpt执行在线提示-参数协同进化,在36个设置中的28个中改善了其匹配基线。

译自 Hugging Face · Daily Papers · arXiv:2608.17310 · 录于 二〇二六年八月十九日