用冻结LM做教师配合层间KV共享,在零额外参数下恢复VLM的语言能力。
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
大语言模型在线策略蒸馏综述
👍 13系统性综述LLM在线策略蒸馏(OPD)的理论框架、方法分类、失败模式和工业实践
把675B的隐私判断蒸馏到150M编码器,本地即可超越教师的人类一致性
因果多镜头架构实现16FPS实时交互式长叙事视频生成
识别采样token蒸馏三大失败模式,提出top-K匹配+19.8%提升
自蒸馏通过压制不确定性表达损害数学推理泛化
CanViT:迈向主动视觉基础模型
👍 13首个任务和策略无关的主动视觉基础模型,用Canvas注意力实现高效序列推理
30B MoE模型通过级联RL+在线蒸馏,在IMO/IOI/ICPC三大竞赛获金牌
8个规模的多语言嵌入模型,覆盖200+语言,14B版SOTA
面向混合 xLSTM 架构的高效蒸馏
👍 34用 mLSTM-SWA 混合架构蒸馏 Transformer,通过专家合并实现近乎无损的性能迁移
通过混合扩散和对抗训练实现少步轨迹可控视频生成,质量与精度双提升
通过知识蒸馏将2B VLM压缩到69M文本编码器,实现高效视觉文档检索
用学生通过率作为权重,按 w(p)=p(1−p) 把蒸馏梯度集中到恰能学会的题目上
通过跨模态对齐将DINOv2转变为能统一处理RGB、深度、分割等多模态输入的视觉编码器
利用用户交互的下一状态信号在线优化个人和通用智能体的RL框架
4B参数医疗智能体通过行为蒸馏实现离线部署,性能媲美前沿大模型
GKD框架通过多阶段蒸馏解耦表征与任务学习,将视觉基础模型的域外泛化能力迁移到轻量学生网络。
基于迭代自策略蒸馏的推理压缩方法
👍 9用自身简洁行为蒸馏模型,无需标注即压缩推理token并提升准确率
手术式后训练:剪除错误,保留知识
👍 12通过最小化编辑的数据修正和奖励二分类损失实现高效推理注入且避免灾难性遗忘
用解耦扩散Transformer将短视频保真度与长时序一致性分离,实现分钟级快速视频生成