渐进剪枝+跨尺度蒸馏,把语音大模型音频编码器从18层压到14层而精度几乎无损
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
重思完整推理轨迹在后训练中的必要性
👍 17推理轨迹中段约20%是冗余的:SFT只保留首尾,效果反超完整轨迹训练
解耦预训练感知与决策、蒸馏统一,端到端驾驶首次超越人类司机
用验证器抽检教师逐题可靠性,按提示在密集OPD与GRPO间独占路由
一个症状,三个杠杆:在策自蒸馏批判性综述
👍 14OPSD以自身加特权信息当教师,但不对称也扭曲信号,可用三个杠杆治理坍缩。
训练时模拟目标模型逐位验证,以验证头与自适应加权对齐草稿训练,加速最高提升8.7%
用冻结教师VLM把已执行行为的语义目标蒸馏进VLA动作解码器,大幅提升操作成功率与泛化
剖析DiT层间记忆偏好,让有界内存的自回归视频模型按状态检索远期历史并只注入敏感层
把训练中现成的逐域反向KL信号变成动态数据配比,零开销让多教师蒸馏更快更强
两阶段训练的多模态嵌入家族:2B 超越 8B 基线,9B 以 80.6 分居 MMEB-v2 榜首
可验证奖励下的在策略蒸馏(OPDVR)
👍 17用一个 ReLU 门控把在策略蒸馏改造成合法的 RLVR 方法,零新增超参数
从原始未压缩模型蒸馏修复压缩+4bit量化LLM,比QAT快7倍且无需早停
把查询解析为六槽位的必需/禁止/可忽略证据,用确定性评分加列表式校验重排图像
自蒸馏QAT与S3D8格式将11B VLM压至3.7GB,Arm CPU手机端高效推理
细粒度MoE+核优化+防遗忘视频微调,稀疏CLIP视觉编码器追平1.7倍大的SOTA稠密模型
用查询条件、长度自适应的潜在概念作中间监督,桥接局部视觉证据与语义相关性
反转师生不对称方向:教师看原图、学生看增强退化视图,用视图落差当免费蒸馏信号
共享文本空间对齐加稳定化技巧,实现跨分词器的长上下文推理在线蒸馏
把自蒸馏教师的特权上下文从手工设计改为可学习的潜在token,端到端内化经验。
SE(3) 几何感知的动作条件视频世界模型,登顶 WorldArena 2.0 预测赛道