通过解耦高频细节与语义特征,在单一模型中实现视觉理解与图像生成的统一优化
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
通过增强条件空间构建多视角奖励映射,提升流模型GRPO对齐效果
统一框架实现多主体身份保持与全方位运动控制,通过潜在空间强化学习优化身份保真度
DVD:基于生成先验的确定性视频深度估计
👍 27确定性地将预训练视频扩散模型转化为单次前向传播的深度回归器
用字形引导SFT+多目标RL解决图像内文字编辑难题,330K数据+15语言基准
提出ELIT机制,通过可变长度潜在接口实现扩散变换器的弹性计算分配和多预算推理
通过迭代潜隐状态精炼实现扩散模型的内生链式思维推理
用 Doob h-变换把粗引导信号注入扩散采样,无需训练和前向算子。
通过低秩旋转建模权重方向变化,将多步扩散蒸馏为高质量单步生成器,参数效率提升10倍。
首个通过In-Context LoRA联合生成个性化音频和视频的方法
通过空间稀疏化和动态token激活实现DiT免训练7倍加速
腾讯混元提出压缩通道维度的连续语义表示,打通统一多模态理解与生成。
零配对视频生音乐,事件曲线解耦时间与语义。
几何引导的强化学习实现多视角一致的3D场景编辑
👍 145基于强化学习的单次推理3D场景编辑框架
首个基于掩码离散扩散的any-to-any多模态模型,统一文本/语音/图像处理
用动态路由将编辑任务分发给异构专家,解决多条件图像编辑中的信号冲突问题
揭示扩散过程与尺度空间的信息层级对应关系,通过广义线性退化实现多分辨率高效生成
基于注意力恢复的免训练潜在帧间剪枝方法
👍 14利用时序冗余的潜在空间剪枝加速视频生成
用不可微奖励强化少步扩散模型,4步生成质量超越80步基线
通过解耦学习目标与双分支流水线,实现既学得新概念又不破坏原模型行为的概念定制。