YOLO-PEFT:面向 YOLO 系列检测器的结构感知参数高效微调框架 YOLO-PEFT: Parameter-Efficient Fine-Tuning on YOLO Family
把 PEFT 适配器放置建模为约束规划,自动为 YOLO 检测器产出可审计可部署方案
前置知识
参数高效微调 PEFT 与 LoRA
参数高效微调(PEFT)冻结预训练模型大部分权重,只学习少量任务相关参数,从而降低适配和分发成本。LoRA 是其中最流行的一种,它把权重更新表示为低秩分解 $\Delta W = BA$($A\in\mathbb{R}^{r\times d_{in}}$,$B\in\mathbb{R}^{d_{out}\times r}$,秩 $r$ 远小于 $d$),训练时只更新 $A,B$ 而冻结原始 $W_0$。衍生方法包括 RS-LoRA(用 $\alpha/\sqrt{r}$ 缩放)、DoRA(把更新分解为幅值和方向)、LoHa、LoKr、IA3、AdaLoRA、HRA 等。本文涉及十余种此类变体在检测器上的对比。
本文不发明新的低秩参数化,而是研究这些已有方法在异构检测器图上‘放在哪里、能否安全放、能否合并导出’的问题。理解 LoRA 等方法的基本机理,才能理解为何‘按模块名匹配’会把它们插到不安全的位置。
YOLO 系列与异构实时检测器
YOLO 是一类实时目标检测器,论文覆盖 CNN 类(YOLOv8/YOLO11)、注意力增强的 YOLO12、文本-图像融合的 YOLO-World、Transformer 解码器的 RT-DETR,以及混合专家(MoE)的 YOLO-Master。它们的计算图高度异构:交织着稠密/分组/深度可分离卷积、与损失耦合的分布焦点损失(DFL)投影、可变形注意力、文本融合层和 MoE 路由。这种异构性使得语言模型里通用的‘按块插适配器’做法在检测器上会出问题。
读懂本文必须理解检测器为何异构——同一个 Conv2d 可能属于骨干、特征金字塔融合、回归头或固定的 DFL 投影,其语义角色决定了能否安全施加低秩更新。这是约束规划要解决的核心对象。
约束满足与约束规划
约束规划(constraint programming)把决策表述为一组必须同时满足的约束:给定变量和约束条件,求解器找出一个使所有约束成立的赋值,或在无解时报告失败。本文把‘给哪些模块分配多少秩的适配器’建模为 $\pi: V_{cand}\to \{0\}\cup K$(0 表示冻结,$r\in K$ 表示放秩 $r$ 适配器),并要求算子有效性、检测语义安全、图接口兼容、预算可行、部署兼容五类约束同时成立;无解时返回 Refuse(拒绝)而非强行给方案。
‘拒绝’作为一等公民是本文相对已有 PEFT 工作的关键区别。理解约束规划的‘有约束才有解、无解就拒绝’思想,才能理解作者为何把安全建模放在效率优化之前。
检测器部署的合并与导出契约
把 LoRA 真正用起来,需要一整条生命周期:冻结基座训练 → 只存适配器权重 → 重新加载到兼容基座 → 把 $\Delta W$ 合并回 $W_0\leftarrow W_0+s\Delta W$ 得到普通模块 → 通过 ONNX/TensorRT 导出。卷积融合在适配器未合并前必须禁用,否则会破坏其宿主模块。本文把这条链路形式化为四条不变量 $I_1$(基座加载不变)到 $I_4$(导出图兼容),并给出分组卷积 LoRA 的合并等价性证明。
一个数值上漂亮的放置若破坏训练或导出就毫无用处。本文的核心贡献之一正是这条‘部署完整的运行时契约’,它是判断方法是否真正可用的关键。
研究动机
从语言模型迁移过来的通用 PEFT 接口会在实时检测器上‘静默失败’。这是因为现代检测器的计算图高度异构:稠密卷积、分组卷积、深度可分离卷积、与损失耦合的 DFL 投影、可变形注意力、文本-图像融合、MoE 路由混在一起,而语言模型大多是结构规整的 Transformer 块。通用 PEFT 接口只按模块名或类型选目标,从不检查算子契约、检测语义、图接口和放置风险;于是无差别插入 LoRA 会直接导致优化失败或 mAP 严重退化。论文用一张 320 分辨率诊断矩阵给出了触目惊心的灾难率:在 CNN-only 的 YOLO11n 上 14 种变体零崩溃(0/10),但在注意力占主导的 YOLO12n 上崩溃率高达 6/7,在 RT-DETR-L 上更是 7/7 全军覆没,DoRA 在 YOLO-World 上甚至出现 $\Delta=-0.292$ 的剧烈发散。这说明‘按模块名放置’的范式在异构检测器上是危险的。
本文的目标是本文不提出又一种低秩参数化,而是把检测器 PEFT 重新表述为异构计算图上的多约束规划问题。给定一个检测器图 $D$、一个 PEFT 请求 $R=(p,T,L,K)$(变体 $p$、可选目标集 $T$、层区间 $L$、允许秩集 $K$)和一个适配器参数预算 $B$,框架要么返回一个结构合法、可训练、可部署的放置方案 $\pi$,要么在校准覆盖范围内当不存在可靠方案时显式返回 Refuse(拒绝)。作者还要把接受方案统一‘下译’为一条可合并、可导出的 YOLO 兼容运行时,并在官方 VOC07+12 trainval→VOC07 test 协议下给出架构条件化的系统证据,量化 VRAM/时间权衡,使‘拒绝并回退到 Full-SFT’成为一等公民而非运行时故障。
与已有工作不同的是,已有工作留下四道空白,本文的独特切入角度正是把它们一并对齐。第一,通用 PEFT 只按模块名/类型选目标,缺少训练前的算子契约、检测语义、图接口和放置风险检查——本文用双角色(算子角色+语义角色)图解析器和有界指纹 $\phi(G)\in\mathbb{R}^{10}$ 弥补。第二,检测器专用方法(SpotPatch、LoRA-Det、YOLO-IOD)的放置策略绑定具体检测器/任务/组件,没有横跨卷积、Transformer、多模态、MoE 的共同抽象——本文用统一的约束接口覆盖五类异构家族。第三,单谈放置不提供训练-保存-合并-导出的端到端契约——本文给出四条不变量与分组卷积 LoRA 的合并等价性证明。第四,以往没有校准机制在开跑前识别高风险架构-适配器组合——本文用校准模式在覆盖范围内给出 Refuse,并用变体级留一法(LOVO)评估。
核心方法
YOLO-PEFT 把检测器 $D$ 表示为有向无环图 $G=(V,E)$,其中 $V$ 是模块实例、$E$ 是张量流边,并把适配器放置写成映射 $\pi: V_{cand}\to \{0\}\cup K$($0$ 表示冻结,$r\in K$ 表示分配秩 $r$ 适配器)。整体是四阶段流水线:①解析检测器,赋予算子角色与语义角色并构造 10 维指纹;②求解约束合法的放置,先做强制性算子/语义过滤再做架构策略,再在预算下分配秩,最后做可靠性校验;③把方案下译为 YOLO 兼容运行时,冻结基座训练、只存适配器、合并后还原为普通模块;④施加训练策略稳定优化。设计哲学是‘有效先于高效’:在结构不安全的层上优化秩分配,得不到可部署方案。规划器输出 $P(G,R,B)=(d,\pi,\mathcal{J})$,$d\in\{\text{Accept},\text{Refuse}\}$,$\mathcal{J}$ 是有序拒绝日志,每个被排除模块都带原因码,区分‘不支持’与‘预测不准’。
核心创新是双角色图解析与‘拒绝’作为一等公民。每个模块被赋予相互独立的两个角色:算子角色 $o_i$ 捕捉计算契约(稠密卷积可用普通低秩因子,分组卷积需组内因子且要求 $G|r$,深度可分离卷积禁止跨通道混合,归一化/激活/未知算子保守排除);语义角色 $s_i$ 捕捉检测含义(固定 DFL 投影、几何敏感的回归路径、MoE 路由被排除,因为小扰动会改变校准分箱或专家分配)。指纹 $\phi_{core}=(\phi_{attn},\phi_{text},\phi_{moe},\phi_{dw},\phi_{conv})$ 度量这些算子的相对占比,驱动稳定性分析与可靠性校准。这与已有方法的本质区别在于:它不依赖统计重要性或数据相关性去‘选重要层’,而是先问‘这个宿主在检测器图接口与语义下是否可被采纳’,并保证完整方案预算可行、可部署;不行就显式拒绝并回退 Full-SFT。
方法步骤详情
步骤①解析:把模型展开为骨干/颈部/解耦头节点,结合图位置与检测习语赋予双角色(算子角色 $o_i$ 与语义角色 $s_i$),并构造指纹 $\phi_{core}=(\phi_{attn},\phi_{text},\phi_{moe},\phi_{dw},\phi_{conv})$。步骤②规划按固定顺序:先算子过滤(移除深度可分离、归一化、未知算子,分组卷积按 $r_g=r/G$ 平衡分配要求 $G|r$),再语义过滤(移除固定 DFL 投影、MoE 路由、几何敏感回归路径),用户目标 $T$ 与层区间 $L$ 只在强制过滤后求交,故显式请求无法重启不安全模块;接着应用家族策略(RT-DETR 冻结解码器采样偏移/注意力权重;YOLO12 排除 $attn.\{qkv,proj,pe\}$;YOLO-World 文本融合可把 LoRA 改路由为 LoHa),然后在预算下分配秩 $\max_\pi\sum u(i,\pi(i))$ s.t. $\sum c_p(i,\pi(i))\le B$,最后做可靠性校验 $\Delta mAP\approx\beta_0+\beta_1\phi_{attn}+\beta_4\xi_p$,预测低于 $-0.05$ 即拒绝。步骤③下译:保证不变量 $I_1$(基座加载不变)到 $I_4$(ONNX/TRT 图兼容),PEFT 后端处理十余种变体,fallback 后端提供纯卷积 LoRA,合并 $W_0\leftarrow W_0+s\Delta W$ 后还原普通模块。步骤④训练策略含层间学习率衰减 $\eta_\ell=\eta_0\rho^{d_\ell}$($\rho=0.85$)、$\alpha/r$ 余弦 warmup、正交正则 $\lambda_{ortho}\|A^\top A-I\|_F$、动态 dropout 在 30% 训练后线性增到 0.15。
技术新颖性
技术新颖性体现在五点。其一,约束形式化与安全模型:把放置定义为算子有效性、检测语义、图接口、部署与预算五类约束的联合满足,并用 10 维指纹在校准覆盖内支持可审计的训练前风险估计。其二,‘拒绝’是一等公民:Refuse→Full-SFT 是规划结果而非运行时故障,避免昂贵试错。其三,合并等价性证明:对 fallback 手工 Conv2d 后端,证明每组更新 $\Delta W_g=B_gA_g^\top$ 重塑后合并 $W_0\leftarrow W_0+s\Delta W$ 可在浮点容差内保持卷积输出不变,分组结构不破坏。其四,部署完整运行时契约:四条不变量覆盖适配器只存权重、合并后还原普通 YOLO 模块、ONNX/TensorRT 看到兼容图。其五,架构条件化证据:14 变体×5 架构的诊断扫描加 YOLO-Master-EsMoE-S 压力测试,证明不存在普适 PEFT 排序,LOVO 在已知架构上达 86.7% 准确率、$F_1=0.850$。
实验结果
在官方 VOC07+12 trainval→VOC07 test 协议(s-scale,600 epoch 上限,640×640)下,YOLO11s 规划器 RS-LoRA 达 0.7138 mAP50-95、HRA 达 0.7276,超 Full-SFT 锚点 0.6428($\Delta$ 最高 $+0.0848$);YOLO12s RS-LoRA 达 0.7307、HRA 达 0.7453,超锚点 0.6662($\Delta$ 最高 $+0.0791$)。秩扫描(Tab. 13)显示 $r=8,16,32$ 单调提升 0.7288→0.7307→0.7363,$r=16$ 为 Pareto 点。RT-DETR-L 七种 LoRA 配置全部跨灾难阈值 $\Delta<-0.05$,规划器发 REFUSE 回退 Full-SFT(0.6833)。与 LM 继承式放置对比(Tab. 3),结构感知方案在 YOLO11s/YOLO12s 分别 $+0.0659/+0.1195$,证明 LM 排名不可迁移。系统审计(Fig. 4):LoRA 峰值显存 16.03 vs 28.57 GB 省 43.9%,但训练 203.8 vs 118.2 s 慢 1.72×。规划器消融(Tab. 11)无约束 0.6900→加算子 0.7094→加头部语义 0.7307,语义守卫是最大稳定性跃升。RS-LoRA×DoRA(Tab. 15)证明 DoRA 关 RS-LoRA 崩溃到 0.6112($\Delta-0.0550$),其余三格正常。MoE 压力测试(Tab. 4)禁用专家/路由目标后 HRA 达 0.7454 vs Full-SFT 0.6891,BOFT/OFT 提前失败。三种子(0/28/42)组内 SD $\le0.006$,排名不变。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| YOLO11s 检测微调(VOC07+12→VOC07 test) | mAP50-95 | 0.7138(规划器 RS-LoRA)/ 0.7276(HRA) | 0.6428(Full-SFT 锚点) | +0.0710 / +0.0848 |
| YOLO12s 检测微调(VOC07+12→VOC07 test) | mAP50-95 | 0.7307(规划器 RS-LoRA)/ 0.7453(HRA) | 0.6662(Full-SFT 锚点) | +0.0645 / +0.0791 |
| RT-DETR-L 检测微调(架构安全决策) | 灾难率 / 规划决策 | REFUSE→Full-SFT 0.6833(7/7 配置超阈值被拒) | 7 种 LoRA 配置全部灾难性($\Delta<-0.05$) | 避免 7 次徒劳训练,约省 23.8 分钟协议内测量时间 |
| 结构感知 vs 语言模型继承式放置(同骨干同预算) | mAP50-95 增益 | YOLO11s +0.0659 / YOLO12s +0.1195 | DoRA(no-rs) 0.6479 / 0.6112 | 结构感知方案大幅领先 |
| 训练资源(YOLO11 受控审计) | 峰值 VRAM / 训练时长 | 16.03 GB / 203.8 s(LoRA) | 28.57 GB / 118.2 s(Full-SFT) | 显存省 43.9%,但训练慢 1.72× |
局限与改进
作者明确承认多项局限。其一,证据仅限 VOC 数据集与已评估的检测器家族,未做 COCO、域漂移、few-shot 评估,也未对比区域级 fine-tuning 基线。其二,可靠性校准只在已观测架构的覆盖范围内有效——校准是‘变体级留一法(LOVO)’而非‘架构级留出’,无法计算未见架构的真假拒绝率,论文反复强调‘拒绝’不构成对未见检测器家族的安全保证。其三,YAML 键 val 实为 VOC2007 test 目录的别名,VOC2007 test 参与了统一的检查点选择协议,因此绝对分数只能支持受控相对比较,不能当作一次性盲测估计。其四,种子数有限(0/28/42 三种子,SD $\le0.006$),仅作稳健性检查而非配对显著性检验。其五,外部来源的存储与分发估计被刻意排除。我的补充观察:预算匹配选择器诊断(Tab. 12)仅一 epoch、2% 子集、160 图验证,无法区分选择器优劣,说明‘目标选择’本身仍缺强证据;Fig. 3 的 Kendall-$\tau$ 仅 v8n/11n 这一对 $p<0.05$,跨家族排序普遍不显著。
独立分析的弱点
第一,校准只覆盖已观测架构,对全新检测器家族无安全保证——改进方向是收集更多家族数据做真正的架构级留出验证,给出真假拒绝率,而非变体级 LOVO。第二,可靠性模型只有 5 个核心维度且依赖变体系数 $\xi_p$,外推能力弱——改进方向是引入更丰富的图嵌入(如子结构同构特征、算子级敏感度)并用贝叶斯方法量化预测不确定性。第三,预算匹配选择器诊断(Tab. 12)地平线过短(一 epoch、2% 子集),四种选择器均值差仅 0.0034 而 SD 达 0.0093–0.0267,无法判优劣——改进方向是在主协议下做长训练、多种子、同预算的真正选择器对比。第四,部署契约只做运行时元数据校验(防后端/路径混淆),缺乏完整基座检查点与类词汇哈希强校验——改进方向是把图哈希、类名校验作为硬检查,提升跨环境部署鲁棒性。第五,显存收益伴随 1.72× 训练时间代价,且 MoE 压力测试中 BOFT/OFT 提前失败——改进方向是研究为何失败并提供针对 MoE 的专家感知放置。第六,VOC2007 test 参与检查点选择削弱了绝对分数可信度——改进方向是引入独立验证集报告盲测估计。
未来方向
作者明确提出未来要扩展到带跨模态注意力与词汇头的 VLM 检测器,以及带共享块的混合 Transformer/MoE 检测器,研究专家局部适配器、路由负载均衡、调度感知预算,并在留出架构和跨域基准(含合并/未合并导出检查)上验证。基于本成果还可延伸:把约束规划框架推广到分割、姿态等密集预测任务;用主动学习自动扩充校准覆盖以降低未见家族风险;研究自适应秩分配(如按层敏感度动态选 $r$)替代固定预算;探索把 Refuse 机制与 AutoML 结合做联合的‘方法+放置’搜索;把合并等价性证明扩展到量化路径与 PEFT 托管的 RS-LoRA/DoRA 变体;以及评估在边缘设备上合并模型相对未合并适配器的真实推理加速(Tab. 6 已显示 YOLO11s 合并后 21.7 GFLOPs 对未合并 25.9 GFLOPs、吞吐 55.8 对 36.1 img/s)。
复现评估
复现性中等偏好。作者提供项目主页 github.com/Tencent/YOLO-Master 作为开源入口,论文详尽描述官方 Ultralytics VOC 配置(训练 16,551 张 trainval、测试 4,952 张 VOC2007 test、640×640、600 epoch 上限、optimizer=auto 解析为 SGD、学习率 0.01、动量 0.9、权重衰减 $5\times10^{-4}$、余弦调度、最后 10 epoch 关 Mosaic、patience 100),并给出种子 {0,28,42}、W&B 字段、VOC 划分审计(Tab. 17 证明训练/评估 ID 交集为零)、合并等价性证明与数值容差检查、ONNX opset 18 校验与 TensorRT FP32/FP16 引擎验证。算力方面 s-scale 600 epoch 在多加速器分布式环境训练,诊断矩阵用 300 epoch/320×320,复现全套矩阵开销不小。难度在于:规划器、图解析器与双后端实现多停留在附录伪代码层面,完整代码与日志开放度需以仓库实际发布为准;RT-DETR-L 拒绝规则依赖校准数据,独立复现需先跑出灾难矩阵才能标定阈值。
论文图表
表格逐行列出七类约束(算子有效性、语义安全、图接口、架构策略、预算可行、部署兼容、可靠性校准),每行给出:输入信息、确定性接受规则、有效时输出、失败时返回的原因码。例如算子有效性要求稠密卷积/线性被所选后端支持、分组卷积需组内因子且 $G|r$、深度可分离/归一化/未知算子排除(E-DEPTHWISE-MIX 等);可靠性校准在覆盖范围内当预测 $\Delta mAP<-0.05$ 时拒绝(R-CATASTROPHE),覆盖外返回不支持(R-OUT-OF-SCOPE)而非外推。
这张表把论文方法形式化为可审计的‘约束-规则-原因码’三元组,是理解约束规划器为何可审计、为何‘拒绝’能区分不同原因的核心,是 method 章节的骨架。
表格用同骨干同评估协议对比结构感知放置与语言模型继承式默认放置,增益为结构感知减继承的 mAP50-95。YOLO11s:LM 默认 DoRA(no-rs) 0.6479 → 规划器 RS-LoRA 0.7138($+0.0659$);YOLO12s:DoRA(no-rs) 0.6112 → RS-LoRA 0.7307($+0.1195$);RT-DETR-L:LM 的 LoRA 扫描灾难性 → REFUSE 回退 Full-SFT。
这张表直接量化了‘结构感知’相对‘按模块名匹配’的价值,是 results 章节证明方法有效性的关键对照实验。
表格报告种子 0 的 MoE 检测器压力测试(VOC,640²,batch 128,600 epoch 上限,禁用规划器/注意力/头/路由/专家目标)。Full-SFT 虽 W&B 状态 crashed 但报告 0.6891;六种出指标的 PEFT 全部完成,最佳为 HRA 0.7454($\Delta+0.0563$),其后 IA3 0.7426、LoKr 0.7402;BOFT 与 OFT 在产出指标前失败(分别 0.08h/0.01h 即终止)。运行时长从 2.14h(RS-LoRA)到 11.37h(HRA)不等。
这张表把评估架构集扩展到 MoE,并说明为何规划器需要能力检查——两配置消耗 setup 时间却从未到达评估,体现了部署契约与能力校验的必要性,是 results 章节 MoE 覆盖的核心证据。
表格在 YOLO12s 与 RT-DETR-L 图上做‘移除某一谓词’的逐项诊断,报告安全目标数、新增可放模块数、梯度比与 $\Delta mAP$。在 YOLO12s 上放开注意力流规则新增 32 模块、梯度范数升至 1.581×、$\Delta-0.0113$(有限,非必然崩溃);放开类型化头规则新增 18 模块、梯度 1.091×、$\Delta-0.0337$;深度可分离谓词在 r=4 未触发(新增 0)。RT-DETR-L 的 MSDeform 几何/Score-bbox 输出层仅作反事实审计。这些是一 epoch、2% 子集的 MPS 诊断,非主协议性能。
这张表区分了‘规则存在’与‘规则真正起作用’,证明了语义守卫是稳定性驱动力而非单纯工程护栏,是 method 与 results 交界处理解约束贡献的关键。
图是受控 YOLO11 系统审计的条形可视化:相对 Full-SFT,LoRA 把峰值 VRAM 从 28.57 GB 降到 16.03 GB(43.9%),但训练时长从 118.2 s 升到 203.8 s(1.72×),所有展示的 PEFT 变体都比 Full-SFT 慢。图与 Fig. 2 互补,强调显存收益伴随时间代价。
这张图把效率权衡用条形直观呈现,强化了‘显存与时间是分离的两条轴’这一核心论点,是 results 章节效率声明的可视化,对理解 Refuse→Full-SFT 为何是合理回退很重要。
表格在 YOLO12s(VOC,LoRA r=16,α=32,RS-LoRA,核心 600 epoch/640 协议)上逐项消融规划器约束:无约束(全 conv+linear+attn)0.6900($\Delta+0.0238$)→ 加算子有效性过滤(dense+linear+attn)0.7094($\Delta+0.0432$)→ 加头部语义过滤(去掉 reg)0.7307($\Delta+0.0645$)→ 全规划器(dense+attn 修剪)0.7307。语义过滤贡献最大稳定性跃升。
这张表是‘约束各组件贡献’的核心消融,证明语义守卫才是稳定性主驱动力,是 method 章节约束设计的直接验证,也支撑 results 章节的结论。
表格在 YOLO12s(VOC,核心 600 epoch/640 协议,锚点 Full-SFT 0.6662/9.26M)上扫描秩 $r\in\{8,16,32\}$:r=8 时 0.7288(9.66M,23.6 GFLOPs),r=16 时 0.7307(10.06M,25.6 GFLOPs),r=32 时 0.7363(10.85M,29.6 GFLOPs)。mAP 单调提升但参数与算力代价增大,r=16 是实用 Pareto 点。
这张表支撑‘规划器默认秩 r=16 是 Pareto 选择’这一论点,并说明 r=8 仅是未校准请求的保守回退而非上限,是 results 章节理解超参与预算的关键。
表格在 YOLO12s(VOC,LoRA r=16,α=32,核心协议)上做 RS-LoRA 与 DoRA 的 2×2 析因。RS-LoRA 关/DoRA 关:0.7094($+0.0432$);RS-LoRA 开/DoRA 关:0.7307($+0.0645$);RS-LoRA 开/DoRA 开:0.7138($+0.0476$);RS-LoRA 关/DoRA 开:0.6112($-0.0550$,唯一跨灾难阈值的角)。
这张表证明训练崩溃不是单由变体标签决定,而是训练侧先验的非加性交互所致,强调必须报告联合配置而非孤立先验设置,是 results 章节训练策略分析的关键证据。