Microsoft Research · 学术

SkillOpt: 将智能体技能作为可训练参数

SkillOpt: Agent skills as trainable parameters

二〇二六年六月三十日 · 英文原文

SkillOpt 将 agent 技能编辑转化为训练过程,视技能文件为冻结目标模型外部的可训练参数,通过有界文本编辑、验证门控、拒绝编辑反馈及慢速/元更新实现受控优化。在六个基准测试(SearchQA、SpreadsheetBench、OfficeQA、DocVQA、LiveMathematicianBench、ALFWorld)、七个目标模型(含GPT-5.5至Qwen3.5-4B)及三种执行模式下,SkillOpt于全部52个评估单元取得最佳或并列最佳结果,不更新模型权重即提升性能。优化后的技能文件紧凑(中位数约920 token,仅采纳1-4次编辑)、可审计且可跨模型规模、agent框架及相关任务迁移,表明其捕获可复用工作流知识。

概览

AI agent 常常失败,因为它们的指令或技能是手动修改的,且无法保证改进。SkillOpt 将技能编辑转化为训练过程,使 agent 行为更可靠,同时不改变模型权重。SkillOpt 将 agent 技能文件视为冻结目标模型外部的可训练参数,将技能编写从一次性提示(one-shot prompting)转变为受控的优化过程。在六个基准测试、七个目标模型和三种执行模式下,SkillOpt 在所有 52 个评估单元中均取得最佳或并列最佳结果,在不更新模型权重的情况下提升性能。SkillOpt 通过有界文本编辑、验证门控、拒绝编辑反馈以及慢速/元更新,保持技能文件紧凑且可审计,避免了不受控制的提示漂移。优化后的技能可跨模型规模、agent 框架和相关任务迁移,表明它们捕获的是可复用的工作流知识,而非特定于基准测试的指令。

大语言模型(LLMs)正越来越多地被部署为能够收集证据、调用工具和执行多步骤任务的 agent。对于这些 agent 而言,难题不再是它们能否调用工具,而是能否可靠且一致地完成任务。目前,agent 技能通常来自三个来源:专家手动编写、前沿模型一次性生成、或 agent 在执行后松散地修订。这些方法都不像深度学习优化器。它们缺乏步长控制、留出验证(held-out validation)以及对失败修订的任何记忆。结果,技能往往随着每次重写而变长并发生漂移,一个看似完全合理的修订可能会悄然降低实际任务性能。这种不受控制的技能演化已成为从 agent 原型到可靠、生产级部署道路上的主要障碍。

在我们最近的论文《SkillOpt: Executive Strategy for Self-Evolving Agent Skills》中,我们将问题从“如何写出更好的提示?”重新定义为“如何训练技能?”SkillOpt 将技能文件视为存在于冻结目标模型外部的可训练参数,引入了训练风格的优化循环,在 52 个评估单元中取得一致的性能提升,并生成一个紧凑、可读、可审计且可迁移的技能文件。

图 1. 冻结的目标模型执行任务,而单独的优化器模型根据轨迹反馈训练技能层,通过验证门控导出可复用的技能文件 best_skill.md

SkillOpt 的工作原理

视频 1. SkillOpt 的优化循环,从轨迹收集到导出的技能文件。

SkillOpt 将技能编辑组织为文本空间中的前向-反向-更新循环。在前向传播中,冻结的目标模型使用当前技能执行一批训练任务;rollout 批次大小控制每次更新接收多少证据。在反向传播中,单独的优化器模型以反射小批次(reflection minibatches)读取生成的轨迹,从成功轨迹中提炼要保留的模式,从失败轨迹中提炼要纠正的模式。在更新步骤中,优化器提出小的添加、删除和替换编辑;候选编辑被合并、去重、排序,并通过文本学习率(即每步编辑预算)进行裁剪。然后,每个候选技能必须通过严格的验证门控:只有当它在留出验证集上的得分严格高于当前技能时,才会被采纳。被拒绝的编辑不会被丢弃;它们会进入一个拒绝编辑缓冲区,作为同一 epoch 中后续优化器调用的负反馈。以较慢的节奏,epoch 级别的慢速/元更新会整合单个批次无法揭示的长期经验(图 2)。总之,有界编辑、验证门控和最佳版本选择使技能优化保持可控和可审计,从而使技能收敛而非漂移。

图 2. SkillOpt 流水线:轨迹收集、小批次反射、有界文本更新、验证门控和 epoch 级别的慢速/元更新共同约束技能训练。

跨基准测试、模型和执行模式的一致性能提升

我们在六个基准测试(SearchQA、SpreadsheetBench、OfficeQA、DocVQA、LiveMathematicianBench 和 ALFWorld)、七个目标模型(从前沿规模的 GPT-5.5 到小型开源权重的 Qwen3.5-4B)以及三种执行模式(直接聊天、Codex 和 Claude Code)上评估了 SkillOpt。将每种组合计为一个评估单元,与人工编写的技能、一次性 LLM 技能、Trace2Skill、TextGrad、GEPA 和 EvoSkill 相比,SkillOpt 在所有 52 个单元上均取得最佳或并列最佳结果。对于一种不更新模型权重的方法而言,这些性能提升异常显著。在直接聊天模式下使用 GPT-5.5,SkillOpt 将六个基准测试的平均分从 58.8 提升至 82.3,绝对提升 +23.5 分——比在每个单元中选择单一最佳竞争方法的 oracle 还高出 +5.4 分。最大的提升出现在程序性基准测试上:SpreadsheetBench 从 41.8 升至 80.7,OfficeQA 从 33.1 升至 72.1,LiveMathematicianBench 从 37.6 升至 66.9。相同的接口也适用于 agent 循环,在 Codex 中将 GPT-5.5 提升 +24.8 分,在 Claude Code 中提升 +19.1 分(相对于无技能基线)。

视频系列《On Second Thought》 与 Sinead Bovell 合作,围绕每个人都在问的 AI 问题展开。借助来自微软各领域的专家声音,我们剖析这一快速变化技术的紧张与承诺,探索正在演变和可能实现的方向。探索系列

小型模型加技能文件:接近下一代模型层级

SkillOpt 还缩小了小型或开源权重模型与前沿模型之间的差距——无需更改任何权重或在推理时增加额外模型调用。优化后,GPT-5.4-mini 的六个基准测试平均分(64.3)超过了更大模型 GPT-5.4 的无技能基线(59.7),GPT-5.4-nano(57.4)超过了 GPT-5.2 的无技能基线(51.3)。Qwen3.5-4B,一个 40 亿参数的开源权重模型,也超过了 GPT-5.2 的无技能基线。曾经需要更大模型才能获得的提升,现在可以通过一个优化的技能文件近似实现。

可迁移的技能:一次训练,随处复用

优化的技能文件捕获的是可复用的任务解决流程,而非过度拟合于单一模型、基准测试或执行环境的指令。这就是为什么同一技能在跨模型规模、agent 框架和相关任务迁移时仍能提升性能。在我们的迁移实验中,技能在跨模型规模、跨执行框架以及迁移到相近的数学基准测试时,仍能持续带来性能提升。最清晰的例子是跨框架迁移:一个在 Codex 内训练的电子表格技能,直接放入 Claude Code 且不做进一步优化,将无技能基线从 22.1 提升至 81.8(+59.7)——略高于直接在 Claude Code 内训练达到的 80.4。由于两个框架暴露了不同的工具接口,这表明 SkillOpt 学习的是通用工作流逻辑,而不仅仅是特定于框架的配方。

紧凑、可读,且仅由极少数被采纳的编辑构成

部署的产物 best_skill.md 既不是不透明的参数块,也不是不断增长的日志。在六个案例研究中,最终技能长度的中位数约为 920 个 token,并且由于验证门控拒绝了大多数提案,最终文件中仅采纳了 1 到 4 次编辑。OfficeQA 的 +39.0 分提升来自一次被采纳的编辑。学到的规则读起来像经验丰富的从业者的建议。组件消融实验证实了这些控制机制的作用:移除拒绝编辑缓冲区会降低所有三个消融基准测试的分数,同时移除元技能和慢速更新则使 SpreadsheetBench 从 77.5 降至 55.0。

Agent 时代的新适配层

SkillOpt 为领域适配 agent 指出了一条更轻量的路径:团队无需微调权重、硬编码任务逻辑或手动调整提示,而是可以训练一个紧凑、可版本化、可审计的自然语言技能层——只要存在自动评估或可靠的验证器。通过将学习率、调度、验证集划分、拒绝样本和慢速更新引入 agent 技能,SkillOpt 表明训练不必局限于模型权重。模型外部的程序性知识也可以被优化。当这一过程受到控制、验证和记录时,自然语言技能便成为连接前沿模型能力与现实工作负载的稳定、可迁移且可逆的适配器。

阅读完整论文,访问项目页面 aka.ms/skillopt,或探索 SkillOpt GitHub 仓库 github.com/microsoft/SkillOpt。构建 agent 工作流的团队可以使用 SkillOpt 作为基础,针对自己的任务和验证器训练可复用的技能。另请参见我们的配套项目 SkillLens。

[论文] [GitHub] SkillLens 项目页面

本文《SkillOpt: Agent skills as trainable parameters》首发于 Microsoft Research。

译自 Microsoft Research · 学术 · 录于 二〇二六年六月三十日