Hugging Face · Daily Papers

RESOURCE2SKILL:从人类创建的多模态资源中提炼可执行智能体技能

RESOURCE2SKILL: Distilling Executable Agent Skills from Human-Created Multimodal Resources

Yijia Fan, Zonglin Di, Zimo Wen, Yifan Yang, Mingxi Cheng, Qi Dai, Bei Liu, Kai Qiu 等 11 位
来自 Microsoft Research
二〇二六年七月二十日 · arXiv:2606.29538 · PDF · Code

技能是软件智能体的一种有用抽象,能将人类和智能体的经验转化为可复用的程序性知识。然而,现有的技能库大多为手工编写、以文本为中心,或从智能体轨迹中衍生而来,导致教程视频及其他多模态人类资源在很大程度上未被充分利用。我们提出RESOURCE2SKILL框架,该框架将包括教程视频、代码仓库、文章和参考制品在内的多模态资源,提炼为软件智能体可执行的技能。RESOURCE2SKILL将这些技能组织成层次化的多模态技能维基(Skill Wiki),其中每个条目结合了结构化文本、代码、视觉示例、元数据和来源信息。这种设计保留了不同资源中的互补信号:视频捕捉时间序列操作和视觉效果,代码捕捉可执行的工具模式,文章或制品则提供概念和风格上的基础。在推理时,智能体从维基中检索并组合相关技能;当覆盖不足时,同一构建算子可在线获取新技能。在七个实际创作领域中,RESOURCE2SKILL相比无技能智能体平均总分提升11.9个百分点,并在28个主聚合模型-领域单元中的26个上优于强基线框架。消融实验证实了多模态技能格式、层次化组织、来源多样性、选择策略和在线获取的价值。

译自 Hugging Face · Daily Papers · arXiv:2606.29538 · 录于 二〇二六年七月二十日