渐进剪枝+跨尺度蒸馏,把语音大模型音频编码器从18层压到14层而精度几乎无损
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
用尖峰-滑块先验加高斯混合的变分学习同时剪枝与量化,压缩率更高且精度损失更小。
从原始未压缩模型蒸馏修复压缩+4bit量化LLM,比QAT快7倍且无需早停
用校准流量驱动的专家合并把推荐MoE压缩为更小的标准MoE,近无损且提速至2.21倍
用单个8B教师同时蒸馏查询端与文档端,得到524M端到端单向量视觉文档检索器
离线缓存教师Top-K对数几率并融合分块KL损失,让蒸馏显存随序列长度线性增长。
基于前缀重放的多轮在线策略蒸馏
👍 11复用教师轨迹做离线多轮 agent 蒸馏,零工具调用、4倍加速且不掉点。
通过剪枝、蒸馏、量化实现移动端高质量电影级I2V生成,40×加速
提出FlashMorph,通过联合优化层间门控,高效选择混合注意力模型的全注意力层
提出DTR协议分析VLA模型架构冗余,发现语言主干高度冗余而视觉动作路径关键
提出FBNL范式,解耦查询-文档计算实现高效重排序,性能媲美工业模型但计算成本降低10-200倍
仅用0.22B参数实现10B级模型性能的图像修复框架
Taylor展开初始化加速Transformer转GDN
ZPPO通过BCQ/NCQ将教师知识仅注入提示词,在31个基准上显著提升小模型性能
剪枝+精确最小化+释放循环,最大压缩 39×
基于内部模型路由的推测解码验证方法
👍 36通过内部模型路由引入轻量级中间验证器,实现分层推测解码,降低拒绝率并提升推理速度
首个MoE转密集架构框架,DO-ACP评分+纯剪枝优于D2D剪枝6.3pp
研究在知识蒸馏前压缩教师推理轨迹的准确率-效率权衡
重构分词器+均值映射+离线蒸馏,高效把多语言教师适配到土耳其语
通过TTT架构实现Softmax Transformer到线性复杂度的快速转换