用低秩二值分解将LLM压缩至1比特以下,单卡H100仅需13小时压缩70B模型
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
利用微调中的权重更新信号优化大推理模型的3-bit量化
通过算法强制执行残差层级结构,解决2-bit量化中的路径共适应问题
将多教师LLM的知识通过五种净化方法整合为单一推理链,缓解冲突并提升蒸馏效果
基于信息量与效用增强的数据集蒸馏方法
👍 21用Shapley值和梯度范数理论指导数据集蒸馏,在ImageNet-1K上提升6.1%
将FFN解耦为无上下文的token级神经检索记忆,提升可解释性并支持预计算卸载
提出学生熵引导的多轴选择性知识蒸馏方法SE-KD3X,在保持性能的同时大幅降低计算开销
提出RTL框架,为不同数据子集发现专门的稀疏子网络,替代传统单一全局剪枝
语言模型知识蒸馏中的记忆动态研究
👍 4知识蒸馏可将训练数据记忆减少50%以上,同时提升模型泛化能力
提出 TAPPA 框架,从时序连续性角度统一解释 LLM 中多样化的注意力模式。
仅用2.3B token将Transformer蒸馏为高效混合模型
Softmax1替换标准注意力,token减少70%、准确率提升27%
通过知识蒸馏将VLA模型从18层压缩到6层,实现2倍推理加速且精度损失<1%
SALAD在视频扩散变换器中引入并行线性注意力分支,实现90%稀疏度和1.52-2.03倍推理加速,同时保持生成质量。
Mistral 3B/8B/14B 模型,级联蒸馏实现高效训练
首个在手机端实现 DiT 高质量图像生成的系统,0.4B 模型 1.8 秒生成 1K 图像