Resource2Skill让智能体学会技能
2026-08-05 12:25:24 · chineseheadlinenews.com · 来源: 微软兖州研究院
当大模型智能体开始制作演示文稿、搭建网页、编辑表格、创建 3D 场景时,决定最终质量的通常不只是一条指令,而是一套具体的“做事方法”:先完成什么、调用哪个工具、检查哪些中间结果,以及失败后如何调整。这些程序性知识作为经验已经广泛存在于人类创造的大量资源中。我们会跟着视频学习操作顺序,从代码仓库理解工具接口,通过技术文章学习设计原则,再参考成熟作品判断最终效果。

但对智能体而言,直接使用这些资源并不容易。比如,教程视频往往较长且包含很多冗余内容;代码仓库能够介绍如何实现,但未必会说明何时使用;技术文章偏重概念、原理,缺少具体步骤;参考作品展示了结果,但常常看不到中间过程。
那么,一个智能体能否像人一样,从资源中学习技能?
对此,来自微软亚洲研究院、加州大学圣克鲁兹分校和上海交通大学的研究员们,联合提出了 Resource2Skill。该系统能够将教程视频、代码仓库、技术文章和参考作品中的经验提炼为智能体能够浏览、组合且执行的多模态技能,并组织成分层Skill Wiki。
简单来说,Resource2Skill 的目标不是让智能体每次遇到任务都重新“读完教程”,而是先将经验沉淀为技能,再根据任务需要进行调用。研究结果显示:

人类会“看教程”,为什么智能体不能直接照着做?
过去几年,不少研究都在尝试为智能体构建“技能库”。然而,大多数技能库主要依赖专家手工编写规则、智能体自身探索产生的轨迹,或者文本与代码形式的资源。这类方法能够记录操作步骤,却很难保存人类经验中那些难以用文字描述的部分。
以教程视频为例,一段操作演示不仅告诉我们“做了什么”,还呈现了先后顺序、界面状态、视觉变化、空间布局和动画节奏等,以及这些步骤之间的关联。直接把整段视频作为上下文输入模型,成本高且重复信息多;若将其压缩成纯文字,又会丢失视频最有价值的时序和视觉信号。代码、文章和参考作品同样存在类似的问题。
因此,Resource2Skill所解决的问题并不是再建一个资料检索库,而是把不同资源中互补的信息,转换为智能体可以重复使用的程序性知识。
技能,不只是一段文字
在Resource2Skill 中,一项技能并不是简单的文本描述,而是一个由多种信息共同组成的能力单元。每项技能都位于领域知识树中的特定位置,同时包含文本、视觉、代码和元数据等多种内容。

不同模态各司其职:文字界定适用性,视觉保存设计意图,代码提供执行落点。即使某项技能没有可直接运行的代码,仍可作为参考型技能存在,为智能体后续生成实现方案提供依据。
为了适应不同的软件领域,Resource2Skill 允许构建专门的技能分类体系。例如,PPT 按版式、字体、配色、图表、动效等组织;Blender 按几何结构、材质、灯光和镜头等组织;Excel则围绕函数、图表和数据分析能力组织。虽然组织方式不同,但它们共享同一套浏览、检索和执行机制。

图 1:Resource2Skill 在网页、Excel、Reaper、PPT、Blender、CAD 和 UE5 等软件创作领域中的部分代表性结果。
一条从资源蒸馏到软件执行的统一链路
Resource2Skill 将技能的构建和使用连接成了一条完整的链路。
首先是资源蒸馏。系统会收集与目标领域相关的视频教程、代码仓库、技术文章以及参考作品,从中提取必键帧、代码片段、文本说明和示例结果,并借助具备视觉能力的大模型生成结构化技能。
接下来是确定性验证。与传统依赖模型的主观判断不同,Resource2Skill 使用明确规则检查技能是否满足完整性、可追溯性、去重、模态一致性以及代码结构可执行性要求。只有通过验证的技能才能进入Skill Wiki。未通过执行检查的代码会被标记为参考型内容,避免被默认当作已验证的工具使用。
然后是分层选择。面对新的任务需求,系统会先在相关领域内检索候选技能,再结合技能的文本、视觉和代码信息进行综合判断,选出最适合当前任务的技能组合。
最后进行组合与执行。智能体通过模型上下文协议(MCP)访问 Skill Wiki 与软件后端,在真实工具中完成规划、应用、渲染和修改等步骤。经过验证的技能代码能够直接作用于软件工具,无需再经过一次语言模型的翻译。

图 2:Resource2Skill 流程。人类多模态资源被蒸馏为分层Skill Wiki,智能体检索并组合相关技能,再通过 MCP 在领域软件中执行。
这条链路也可用于在线补缺。如果离线 Wiki 没有覆盖某项能力,系统可以重新搜索相关资源,以同样的蒸馏和验证流程建立独立的临时技能池。离线积累与在线获取不是两套系统,而是同一个“资源到技能”算子的两种使用方式。
七类软件创作任务,平均提升 11.9%
研究员们在 PPT、CAD、Web、Excel、Blender、UE5 和 Reaper 七个软件创作场景中对Resource2Skill进行了评测。实验覆盖 GPT-5.5、GPT-5.4、GPT-5.4 Mini 和 GPT-5.4 Nano 四个模型后端,并包含4,893 个活跃技能条目,其中既有经过验证的可执行技能,也有提供文字与视觉依据的参考型技能。
每个领域的主实验都使用了 80 个匹配任务,来比较完整的 Resource2Skill、无技能智能体,及Claude Code 和 Codex 两类现成智能体执行框架。

提升在操作步骤复杂、工具约束较强的任务中尤为明显。以 GPT-5.4 为例,Excel 从 58.6 提升到 76.4,Blender从 29.5 提升到 44.1,UE5 从 29.1 提升到67.3。Reaper 的提升相对较小,从 73.2 到 77.3,说明基础模型原本对这一媒介已有较强的先验。
除自动评测外,研究员们还对跨七个领域的作品进行了匿名人类 A/B 测试。在200 个独立投票中,有技能版本获得了 136 票,无技能版本获得 23 票,其余为平局。剔除平局后,有技能作品的胜率达到 85.5%。
为什么视频、多模态和分层 Wiki如此重要?
研究员们进一步通过消融实验分析了性能提升的来源。

结果表明,视频资源发挥了关键作用。当移除视频,仅保留代码、文章和参考作品时,整体成绩从 68.9 降至 59.4。而仅使用视频时,成绩仍达到 66.8。换句话说,视频并不是其他资源的冗余版本,而是提供了独特的信息来源。对于高度依赖操作流程和视觉反馈的任务,视频的重要性更加明显:Web任务下降了 11.5%,Excel 任务下降了 14.2%。
研究还发现,多模态信息带来的提升并不仅仅来自“更多文字”。视觉与代码分别提供了独立增益,而分层Skill Wiki 则显著优于传统扁平化技能库。
另一方面,技能数量也并非越多越好。当技能规模增长到约 200 项后,整体收益开始逐渐趋于稳定。在线获取新技能虽然对标准任务帮助有限,但当系统遇到离线技能库尚未覆盖的新能力时,可以带来超过20%的性能提升。因此,它更适合被理解为一种可控的“能力补丁”,而不是每次任务都启动无限搜索。
从“存知识”走向“存方法”
Resource2Skill 展示了一种面向软件智能体的新型外部记忆机制。它并不试图把所有经验压缩进模型参数中,也不依赖每次任务都重新阅读大量原始资源,而是将人类长期积累的教程、代码和作品转化为可检索、可验证、可执行的技能资产。
这样的设计带来了几个重要优势:技能可以像 Wiki 一样持续维护;不同模态能够在需要时按需展开,减少上下文负担;同一套流程既能构建离线技能库,也能在线补充新能力。
当然,拥有技能并不意味着一定成功。论文中的失败案例显示,如果公式变量没有正确绑定、视觉参数没有真正继承,或者智能体过于机械地套用某个模式,技能可能产生错误或限制创意。
但从更长远的角度看,这项工作揭示了一个重要趋势:对未来的智能体而言,仅仅拥有知识已经不够,更重要的是拥有完成任务的方法。