← 返回 2026-07-20

Resource2Skill:从人类创建的多模态资源中蒸馏可执行的软件智能体技能 RESOURCE2SKILL: Distilling Executable Agent Skills from Human-Created Multimodal Resources

Yijia Fan, Zonglin Di, Zimo Wen, Yifan Yang, Mingxi Cheng, Qi Dai, Bei Liu, Kai Qiu, Yue Dong, Ji Li, Chong Luo 📅 2026-07-16 👍 139 2026-07-25 18:30
多模态蒸馏 技能检索 教程视频 智能体技能库 程序性知识 软件智能体

把教程视频等多模态资源蒸馏为层次化可执行技能库,提升软件智能体创作能力

前置知识

软件智能体与工具调用

大型语言模型智能体不再只是回答问题,而是要操作软件、调用工具、检查中间结果并产出高质量制品(幻灯片、电子表格、网页、Blender 三维场景、CAD 设计、UE5 实时三维、音频作品等)。这类任务成功与否往往取决于可复用的程序性知识:如何分解目标、用哪种工具或 API 模式、检查什么中间状态、操作失败如何恢复。本文将这些可复用的程序性知识抽象为“技能(skill)”。

理解软件智能体的运行机制和技能的作用,才能明白为什么需要一个技能库,以及技能如何被检索和执行来提升智能体在复杂创作软件上的表现

技能库(Skill Library)

技能库是把人和智能体的经验转化为可复用程序性知识的集合。现有技能库主要有三种构建方式:专家手工编写、从智能体自身交互轨迹累积、从文本/代码资源挖掘。本文提出第四种:从多模态人类创建的资源(教程视频、源代码仓库、文章、参考制品)蒸馏出可执行技能。每个技能是一个元组 $s = \langle p, x_{text}, x_{visual}, x_{code}, m \rangle$,其中 $p$ 是领域分类法中的路径,三种内容视图(文本、视觉、代码)互补,$m$ 是元数据。

技能库是本文的核心抽象,理解其构建方式和组织形式(层次化多模态 Wiki)是把握全文贡献的基础

BM25 词法检索与稠密检索

BM25 是一种经典的词法检索打分函数,根据查询词与文档的词频和逆文档频率计算相关性。稠密检索(Embed)则用神经网络把查询和文档编码为向量,用余弦相似度匹配。本文的 MetaBrowse 选择策略采用层次化两级方案:第一阶段用 BM25 把候选集缩窄到分类法中主题相关的子树,第二阶段让语言模型从候选中挑选子集进行组合,公式为 $C_K(q) = \text{TopK}_{s\in\Sigma_D}\, \text{BM25}(q, \text{name}(s)\oplus\text{tags}(s)\oplus\text{applicability}(s)\oplus p(s))$。

理解检索基线的原理,才能看懂选择策略消融实验中本文方法相对 BM25、Embed、BM25+Embed 的优势来源

MCP(Model Context Protocol)

MCP 是一种让语言模型与外部工具/服务交互的协议接口。本文中智能体和领域适配器共享同一套 MCP 工具界面:技能库侧暴露发现类动作(列出分类、列出技能及其元数据卡、读取各模态内容)以及一个包裹 BM25 短名单的搜索动作;领域侧暴露一个由领域能力清单支撑的 apply 动作。一次运行在所有领域遵循相同的控制循环(规划、MetaBrowse、apply、渲染),选中的技能代码直接在真实的 MCP 服务器上执行。

MCP 是技能从选择到执行的关键桥梁,理解它能明白本文为何强调“选中即执行、无需模型翻译”

多模态蒸馏(Multimodal Distillation)

多模态蒸馏是指从视频、代码、文章、制品等高维异构资源中提取并标准化为统一可复用表示的过程。本文用一个具备视觉能力的语言模型 $f_\theta$ 作为多模态蒸馏器:它针对领域查询检索资源,提取模态专属证据(关键帧、代码区域与参数签名、散文段落、渲染样例),蒸馏成 $(p, x_{text}, x_{visual}, x_{code}, m)$ 并归一化。直接把原始视频放进智能体记忆昂贵且冗余,而把视频压缩成纯文本又丢失了动态操作、前后视觉变化、动画质量、空间布局、时序等关键信号,因此需要这种蒸馏。

多模态蒸馏是本文方法的核心机制,理解它才能明白为什么教程视频是“不可替代的来源”以及多模态技能格式的价值

研究动机

基于大型语言模型的智能体越来越多地被要求操作软件、调用工具、检查中间结果并产出高质量制品,如幻灯片、电子表格、网页、Blender 三维场景、CAD 设计和音频工程。在这类场景中,成功与否很少取决于孤立的事实知识,而更多取决于可复用的程序性知识:如何分解目标、用哪种工具或 API 模式、检查什么中间状态、操作失败如何恢复。然而现有技能库的构建方式都存在严重局限:要么由专家手工编写(昂贵、难以规模化),要么从智能体自身的交互轨迹累积(受限于智能体自身经验),要么从文本/代码资源挖掘(忽略了一个最丰富的人类学习来源——教程视频)。对许多商业和创作软件任务而言,人类最自然的学习方式不是阅读静态文档,而是观看教程、演示和屏幕录制工作流。一段视频教程能揭示操作的时序顺序、每个编辑步骤的视觉效果,以及难以用文字表达的隐性设计选择。但直接把原始视频塞进智能体记忆既昂贵又冗余(一段教程可能包含数分钟无关的设置、重复旁白),而把视频压缩成纯文本摘要又恰恰丢掉了视频之所以有用的信息:动态操作、前后视觉变化、动画质量、空间布局、时序和工具交互顺序。

本文的目标是本文的具体目标是构建一个框架,能自动从人类创建的多模态资源(尤其是教程视频,也包括源代码仓库、文章、文档和参考制品)中蒸馏出可执行的技能,并将其组织成一个可维护的、层次化的多模态技能库供软件智能体使用。更具体地,目标包括四个层面:(1)离线从大规模资源蒸馏出领域专属技能并按层次化 Skill Wiki 组织;(2)在推理时让智能体先导航层次化索引形成候选技能池,再读取相关多模态条目并在执行中组合;(3)当离线库覆盖不足时,复用同一个资源到技能的算子在线获取新技能并增量扩展库;(4)跨越七个实际创作软件领域(幻灯片设计 PPT、网页生成 Web、电子表格 Excel、Blender 三维场景、CAD 设计、UE5 实时三维、音乐制作 Reaper)系统验证技能访问带来的提升。

与已有工作不同的是,本文的独特切入角度是把技能构建与技能使用视为统一流水线,并把来源类型、模态、库规模和选择策略都变成可控的设计变量。与 Voyager、AWM、ASI、SkillFlow 等在线从单一领域智能体轨迹或失败中生长文本/代码库并靠稠密相似度检索的方法不同,本文离线挖掘多模态技能(视频、仓库、文章、制品);与 Anthropic Agent Skills 手工编写文本/代码/资产包且无自动获取不同,本文有自动构建算子;与精神最接近的 SkillFoundry(离线挖掘文本/代码技能为科学计算构建自顶向下知识树)不同,本文结合了多模态技能、层次化 Wiki 界面配合层次先于语言模型的选择策略、基于视觉和音频评判的制品级评估,以及受控的在线补缺。关键洞察是视频携带文本难以充分表达的时序操作与视觉序列信号,必须蒸馏而非简单检索或文本化。

核心方法

Resource2Skill 的整体直觉是:人类最擅长通过观看教程来学习创作软件的操作,那么就把这种多模态人类经验蒸馏成智能体可直接检索和执行的结构化技能。技术路线被实例化为四个阶段:构建(construction)、Wiki 组织(wiki organization)、选择(selection)和执行(execution)。离线阶段,构建算子把多模态资源蒸馏成领域 Wiki;推理时,给定用户需求,智能体先用层次化索引 MetaBrowse 形成候选技能池,再读取相关多模态条目并在执行中组合;当离线库不覆盖所需能力时,同一个资源到技能的算子可被在线调用来搜索新资源、提取额外技能并增量扩展库。所有四个阶段共享一个由 MCP 中介的浏览-选择-执行界面,覆盖七个领域专属后端(PPT、CAD、Web、Excel、Blender、UE5、Reaper),每个领域有 80 个任务 brief 且与构建库的资源语料无重叠。

核心创新点有三处,与已有方法本质不同。第一,把技能建模为多模态元组 $s = \langle p, x_{text}, x_{visual}, x_{code}, m \rangle$,其中文本说明适用性与机制、代码提供工具落地执行模式、视觉示例保留布局/风格/运动等文本无法充分指定的感知信息——这使技能库不再是扁平的检索段落集合。第二,层次化组织:技能按领域分类法(如 PPT 按版式/排版/动效,Blender 按几何/材质/光照/构图组织)挂载,MetaBrowse 的第一阶段 BM25 打分关键地把分类法路径 $p(s)$ 纳入,使 Wiki 树直接偏向落在主题相关子树中的技能,而非把库当作扁平列表。第三,离线与在线复用同一构建算子 $(f_\theta, \mathcal{A}_D)$,使在线获取不增加额外流水线,且离线/在线池在实验中严格分离,确保在线获取只是受控的能力补缺而非测试时不受控的上下文膨胀。

方法步骤详情

方法分四个阶段。构建阶段:领域 $D$ 的资源池 $\mathcal{R}_D$ 来自四类来源(教程视频、源代码仓库、文章、参考制品)。多模态蒸馏器 $f_\theta$ 把每个资源 $r\in\mathcal{R}_D$ 映射为候选技能 $\tilde{s}_{1:k}=f_\theta(r,D)$:针对领域查询检索资源,提取模态专属证据(关键帧、代码区域与参数签名、散文段落、渲染样例),用视觉能力语言模型蒸馏成 $(p,x_{text},x_{visual},x_{code},m)$ 并归一化;领域谓词 $\mathcal{A}_D$ 强制完整性、可溯源出处、去重、模态一致性、代码可执行性五项检查,最终库 $\Sigma_D=\{\text{normalize}(\tilde{s}):\tilde{s}=f_\theta(r,D),\mathcal{A}_D(\tilde{s})=1\}$。选择阶段:给定 brief $q$,MetaBrowse 两级操作——先用 $C_K(q)=\text{TopK}_{s\in\Sigma_D}\,\text{BM25}(q,\text{name}\oplus\text{tags}\oplus\text{applicability}\oplus p(s))$ 缩窄候选,再让语言模型读证据 $\Phi(s)$ 选子集 $S(q)=\pi_\phi(q,\{\Phi(s):s\in C_K(q)\})$,选择是子集而非排序(可零选)。执行阶段:选中技能代码直接在真实 MCP 服务器上执行无需翻译,参考型技能则由智能体据其文本与视觉证据改写自身代码。在线获取:当 $C_K(q)$ 无足够候选时,同一算子 $(f_\theta,\mathcal{A}_D)$ 在线发针对性查询、蒸馏临时候选、验证后作为独立在线池暴露。

技术新颖性

技术新颖性体现在多方面。首先,这是首个系统地把多模态人类资源(尤其教程视频)蒸馏为可执行技能并跨七个商业创作软件领域评估的框架,把来源类型、模态、库规模、选择策略都变成受控变量而非隐藏的实现细节。其次,层次化多模态 Skill Wiki 的表示设计——每个技能组合结构化文本、可执行代码、视觉示例、元数据与出处——使技能库超越扁平检索集合,消融证明纯文本技能库已能提升各领域表现,而完整 Wiki 比扁平纯文本在每个领域多 2.5–8.2 pp。第三,层次先于语言模型的 MetaBrowse 选择策略($C_K$ 后再 $\pi_\phi$ 子集选择)在五个领域均胜过 BM25、Embed、BM25+Embed、随机和 No-Skill,平均 68.9% vs BM25 的 66.0%。第四,离线/在线复用同一算子并用 $T_{novel}$ 压力测试套件验证在线获取是 gap-filler(+21.6 pp)而非 booster($T_{standard}$ 仅 +0.7 pp)。第五,制品级评估采用对系统标签盲测的视觉/音频评判,配合盲测人类 A/B 研究,方法学上较为严谨。

Resource2Skill pipeline.
Figure 2: Resource2Skill pipeline.

实验结果

核心发现:主对比(Table 1,每领域 N=80,四个后端 GPT-5.5/5.4/5.4 Mini/5.4 Nano)中 w Skills 在全部 28 个主聚合模型-领域单元击败 w/o Skills,平均 56.8% vs 45.0%,即 +11.9 pp;两个开箱 harness(Codex-H 50.5%、ClaudeCode-H 50.4%)单独也能提升无技能智能体但仍低于 w Skills,后者在 26/28 单元击败两者中较强者(两个例外差距<1 分),配对 Wilcoxon p<$10^{-3}$,说明主导提升来自策展 Wiki 而非 harness。提升集中在约定密集领域,UE5 最大(+30 至 +40 pp,GPT-5.4 下 67.3 vs 29.1),Reaper 最小。盲测人类 A/B(5 评分者/对,40 对,200 配对评分)在七领域 corroborate,w Skills 在非平局评分中胜出 85.5%。技能库规模研究:性能随库规模单调上升,约 200 个技能处饱和,0→200 切片增益最大(Reaper +3.1 pp 到 Excel +14.2 pp),200 后趋平(400→Full 至多 +0.8 pp)。在线获取(Table 2):$T_{standard}$ 仅 +0.7 pp,$T_{novel}$ +21.6 pp(41.2%→62.8%),证实在线是 gap-filler。来源消融(Table 3):视频不可替代,剔除它平均 68.9%→59.4%,仅视频库仍比三来源无视频库高 7.4 pp。表示消融(Table 4,匹配预算):Text 65.0%、+Visual 66.9%、+Code 67.0%、Full 68.9%(视觉 +1.9、代码 +2.0 pp)。选择策略(Table 5):Ours 68.9% > BM25 66.0% > BM25+Embed 64.2% > Embed 60.0% > Random 58.0% > No-Skill 57.3%。

Main comparison, overall score (%).
Table 1: Main comparison, overall score (%).
Offline and online skill acquisition, overall score (%).
Table 2: Offline and online skill acquisition, overall score (%).
Ablation: resource-source mix, overall score (%).
Table 3: Ablation: resource-source mix, overall score (%).
Matched-budget representation ablation, overall score (%).
Table 4: Matched-budget representation ablation, overall score (%).
Ablation: selection strategy, overall score (%).
Table 5: Ablation: selection strategy, overall score (%).
查看结构化数据
任务指标本文基线提升
七个创作领域平均总体得分(N=80/领域,四个后端) Overall Score (%) w Skills 平均 56.8% w/o Skills 平均 45.0% +11.9 pp(28/28 单元全胜,Wilcoxon p<10^-3)
对比开箱即用智能体 harness Overall Score (%) w Skills 56.8% Codex-H 50.5%, ClaudeCode-H 50.4% 在 28 个主聚合单元中赢 26 个
UE5 实时三维场景构建 Overall Score (%) GPT-5.4 w Skills 67.3 GPT-5.4 w/o Skills 29.1 +38.2 pp(最大领域增益)
Wiki 组织 vs 扁平纯文本(N=80/领域) Overall Score (%) Our Wiki 全领域最优 Flat 纯文本技能 +2.5 至 +8.2 pp(Excel/Web/Blender 最大)
来源消融(视频是否不可替代) Avg Overall (%) 全来源 68.9% 去视频(Code+Article+Artifact)59.4% +9.5 pp,视频不可替代
选择策略消融(N=40/领域) Avg Overall (%) Ours(MetaBrowse)68.9% BM25 66.0%, BM25+Embed 64.2%, Embed 60.0%, Random 58.0%, No-Skill 57.3% 五领域全胜,比最强检索基线 +2.9 pp

局限与改进

作者承认及可观察到的局限包括:第一,在线获取在标准基准 $T_{standard}$ 上仅带来 +0.7 pp 的近乎噪声的提升,说明其价值限于能力缺口区域,对常规请求增益有限。第二,提升幅度因领域差异显著,Reaper 等媒介上无技能先验已较胜任,技能库增益最小,暗示对某些“约定稀疏”领域技能库边际收益递减。第三,技能库约在 200 个技能处饱和,之后增加技能几乎无增益(400→Full 至多 +0.8 pp/领域),这意味着库规模的进一步扩展未必划算。第四,评估主要依赖 GPT-5.4 视觉评判(音频域用 GPT-4o 系列),评判本身是模型打分,虽盲测系统标签但仍存在评判模型自身偏好的风险。第五,我自己观察到实验后端高度依赖 GPT-5.x 系列与闭源 harness(Claude Code、Codex),缺乏对开源模型或更广泛后端的验证;技能 Wiki 的构建质量取决于蒸馏器 $f_\theta$ 与领域谓词 $\mathcal{A}_D$,构建成本与可维护性未充分披露;$T_{novel}$ 的 +21.6 pp 虽亮眼但在线蒸馏的新技能来源可控性、质量稳定性及延迟开销未被量化。

独立分析的弱点

独立分析的弱点及改进方向如下。第一,评估后端全部为 GPT-5.5/5.4/5.4 Mini/5.4 Nano 及两个闭源 harness,未涵盖开源模型;不同模型族在工具调用稳定性上差异巨大,建议补充 Llama/Qwen 等开源后端验证技能库增益的模型无关性。第二,技能库构建依赖视觉能力语言模型离线蒸馏,构建算力与库的可维护性(如领域版本演进时如何更新过时技能)几乎未量化;可引入自动化技能新鲜度检测与增量式重蒸馏。第三,MetaBrowse 第一阶段固定用 BM25 词法检索,对术语分布偏移或同义命名敏感,可探索学习式路由作为第一阶段。第四,选择阶段只选子集,未显式建模技能间组合兼容性与冲突,复杂任务中多技能可能互相矛盾;可引入组合校验或冲突消解。第五,$T_{novel}$ 在线获取虽提升 21.6 pp,但在线蒸馏延迟未被讨论,实际部署可能影响体验;改进方向是缓存与预蒸馏常见缺口。第六,评判完全模型化,人类 A/B 仅 200 配对评分、样本有限,建议扩大人类评估规模并报告评判间一致性。

未来方向

作者隐含与可延伸的方向包括:第一,扩展到更多创作软件领域(如视频剪辑、图形设计、数据分析可视化),验证框架的领域无关性。第二,研究技能库的持续学习与版本管理——当软件 API 演进时如何检测过时技能并自动重蒸馏,以及如何处理技能间的依赖与冲突。第三,将层次化 Wiki 组织与选择策略推广到更通用的智能体记忆系统,例如把技能元组 $s = \langle p, x_{text}, x_{visual}, x_{code}, m \rangle$ 的多模态表示用于机器人操作或真实世界任务技能。第四,在线获取目前默认关闭(仅作 gap-filler),可研究何时自动触发在线获取的判据,以及在线获取技能是否及如何回填到离线库以实现真正可增长的程序性记忆。第五,基于技能库饱和约 200 个的发现,研究领域技能的“最小充分集”与主动学习式技能挖掘,降低构建成本。第六,把技能组合从“子集选择”升级为显式的技能编排/规划,让智能体学会技能间的时序与数据依赖。

复现评估

复现评估如下。作者提供项目代码(https://aka.ms/Resource2Skill),附录 A 给出每领域库规模与可执行性协议,附录 C 给出 ClaudeCode-H/Codex-H 的 CLI 版本、调用契约与匹配配置,附录 L 给出技能库磁盘实现,附录 B/F 给出评判协议与人类-评判一致性,附录 G 给出配对结果计数与 Wilcoxon p 值,文档完整度较高。数据上每领域有 80 个经筛选 brief 池且与资源语料无重叠,brief 作者对 Wiki 与智能体盲测,方法学严谨。算力方面构建阶段需视觉能力语言模型蒸馏大规模多模态资源,推理阶段四个后端均为闭源 GPT-5.x,所有调用温度 0、推理努力 low,门槛较高。复现难度中等偏高:核心算法(蒸馏算子 $f_\theta$、谓词 $\mathcal{A}_D$、MetaBrowse 两级选择、MCP 执行)思路清晰可复刻,但完整复现依赖闭源后端与 harness、大规模多模态资源语料,且构建算子与领域谓词的具体提示/实现细节可能未完全开源,七领域后端(尤其 UE5、Blender、Reaper、CAD)的渲染与评判路径工程量巨大。