将冗长few-shot示例蒸馏为结构化分类标准和任务描述,提升B2B对话分类性能和可解释性
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
仅用0.22B参数实现10B级模型性能的图像修复框架
Taylor展开初始化加速Transformer转GDN
通过软正确性门控和教师概率缩放改进 GUI 定位自蒸馏中的教师信号质量
首个针对扩散LLM的自蒸馏框架,用自生成答案作后缀条件,步级监督提升推理能力
ZPPO通过BCQ/NCQ将教师知识仅注入提示词,在31个基准上显著提升小模型性能
将大模型推理能力蒸馏到系统提示中,实现无需参数更新的高效推理
通过二元验证器信任信号改进在线策略蒸馏,在数学推理基准上平均提升1.98%
通过将推理内化到分数分布中超越标量奖励
👍 65提出Z-Reward教师-学生框架,将推理增强的分数分布蒸馏到高效的学生奖励模型中
提出Latent Memory,将每条多模态证据压缩为一个高维潜在token,实现高效的问答系统
TRD通过轨迹级修正解决OPD前缀失效问题
首个MoE转密集架构框架,DO-ACP评分+纯剪枝优于D2D剪枝6.3pp
研究在知识蒸馏前压缩教师推理轨迹的准确率-效率权衡
提出OPDLM方法,将ARLM转换为DLM,训练token减少15-7000倍
首次将在线蒸馏提升到隐藏状态空间,解决方差瓶颈和信息压缩问题,实现Pareto优势
通过模态感知的一致性蒸馏,将世界动作模型的推理延迟从8.1秒降至348毫秒,实现23倍加速
GeoVR 通过从2D视频提取几何约束,零推理成本赋予MLLMs强大的3D空间感知能力。
自蒸馏策略梯度
👍 28把全词表自蒸馏与RLVR奖励统一为策略梯度,稳定提升LLM推理性能。
FiRe-OPD 用轨迹级硬过滤加 token 级软加权协同优化在线蒸馏粒度。
信任域在线策略蒸馏
👍 47用信任域分割策略梯度可靠区,稳定蒸馏推理小模型。