AI Agent 的 Skill 被寄予厚望,大家觉得装上技能就能让大模型变身领域专家,但过往测试大多是理想条件:直接给模型定制好的专属技能。这篇论文把场景拉回现实,搭建 34000 条真实技能库做实验,发现技能的增益其实十分脆弱,一旦需要模型自己检索、挑选、适配技能,效果会大幅滑坡。
为此论文对比了两种技能优化方案,核心就是技能精炼:对检索得到的原始技能裁剪改写,适配当前任务。其中查询专属精炼,是接到具体任务后才动态整合改写技能,效果最优,但精炼只能放大已有信息,不能凭空创造知识,原始素材质量差,再优化也于事无补。
文章链接:How Well Do Agentic Skills Work in the Wild: Benchmarking LLM Skill Usage in Realistic Settings
