让全模态对话模型不仅开口说话,还能以参考形象生成口型同步的视频回应
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
用单个8B教师同时蒸馏查询端与文档端,得到524M端到端单向量视觉文档检索器
用质量校准排序与跨层自蒸馏修复 query 竞争错配,仅改训练、推理零开销,三类分割一致涨点
把大教师智能体的成功经验分层蒸馏为工作流/子任务/函数三级记忆,免训练注入 4B-8B 小智能体
用稀疏位置探测与验证器校准的蒸馏目标,提升小模型数学推理覆盖
离线缓存教师Top-K对数几率并融合分块KL损失,让蒸馏显存随序列长度线性增长。
用执行中心的能力分类法训练四类专家再合并蒸馏成统一具身VLM
面向多语言数学推理的在线策略增量蒸馏
👍 31将OPD2蒸馏扩展至英/韩/日数学推理,揭示推理迁移与语言保留的差异。
统一模型实现多镜头视频生成、参考生成与编辑,单GPU达16.74FPS。
当教师误导时:伪信号感知的在线策略蒸馏
👍 22过滤在线蒸馏中既不依赖输入又高影响的虚假教师信号
RSTG在负零方差样本上选择性施加自适应蒸馏,恢复GRPO丢失的梯度信号
对比师生轨迹差异,把行为差距蒸馏成可验证的文本技能,增强冻结的弱学生智能体
用像素桥接与可切换适配器把异构教师能力蒸馏进单一学生
OPD-V:基于模态平衡的视觉在线自蒸馏
👍 10把模态平衡本身作为在线自蒸馏的特权信息,用正负双教师提升多模态推理
面向智能体强化学习自蒸馏的持久一致性方法
👍 38按教师信号的局部持久性,为每个 token 分配自适应蒸馏权重。
首个在任意异构流匹配模型间实现跨族在策略蒸馏的通用框架
用8个可学习恢复token生成上下文条件化紧凑缓存,弥补KV驱逐损失。
用反事实视觉干预分离教师修正中由视觉解释的部分并重构学生监督目标
把 Gemma 4 微调成开源离散扩散模型,单 H100 上约 1500 tokens/s。
弱到强同策略蒸馏
👍 55用弱模型的对数几率差合成代理教师,蒸馏出超越弱教师、逼近自身的强学生。