解析Agent技能:为何有效,直至失效
Demystifying Agent Skills: Why They Work-Until They Don't
来自 University of California at San Diego
摘要
技能已成为一种实用且有效的方法,通过在推理时提供结构化的知识包来增强LLM代理。然而,现有评估大多衡量技能是否提升聚合任务成功率,却未深入探讨一个更根本的问题:\textbf{技能何时有帮助、为何有效、又在何处失效?}通过在多个基准、代理框架和LLM上进行的受控实验,我们分离了技能的表征效果、结果标注、检索难度及跨框架鲁棒性。为进一步回答此问题,我们设计了一项对比研究,将受控定量实验与配对轨迹分析相结合。我们规范化了受控实验中的8,135条试验记录,并从240条开放编码记录中保留了238个有效唯一标签。我们将这些观察归纳为一个包含三个高层类别和十二种技能使用模式的分类体系:当噪声轨迹成为稳定执行的过程锚点时,技能发挥作用。在匹配比较中,技能比工作流记忆高出6.06分。过程锚定占技能案例的65.7%,而显式知识注入仅占4.5%,表明技能稳定行动而非注入缺失事实。检索是一个独立瓶颈:当池规模从5增至100时,实际使用精度从29.6%降至3.3%。混淆干扰项损害离线识别,但下游成功率保持稳定;精确的真实标签调用既非充分也非必要条件。技能在脆弱假设、不兼容上下文或适应不足时失效。这些发现将评估推进到聚合成功率之外,并指导可靠的自进化代理。
译自 Hugging Face · Daily Papers · arXiv:2608.14036 · 录于 二〇二六年八月十九日