把奖励信号拆解到 rollout 与像素级,对 DMD 蒸馏做时空局部化加权。
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
首次把测试时 scaling 引入流式视频生成,三机制协同提升长视频时空一致性。
VLM规划+扩散生成,两阶段生成可交互的物理3D资产
让步数蒸馏扩散模型持续学习新概念而保持少步推理能力
京东提出统一多模态模型 JoyAI-Image,以空间智能为枢轴打通理解、生成与编辑。
扩散模型作为通用分割学习器
👍 4把预训练扩散模型改造为统一的语义/开放词汇/跨域分割框架
基于预测式潜空间的视频生成
👍 25提出预测式视频VAE,丢弃未来帧使潜空间捕获运动先验,提升34.42 FVD并加速收敛52%
把扩散时间步张量化,全采样组合空间,加速训练并解锁分级控制推理。
MotionCache 以帧差代理运动,token 级缓存将视频生成加速至 7.26×
串联扩散编辑与Im2Im分布匹配,刷新合成数据CMMD指标。
基于视频扩散先验的统一框架,单模型支持15种像素对齐任务的文本/视频间多模态生成。
扩散模型何时才能学会生成多物体?
👍 9用受控MOSAIC数据集揭示扩散模型多物体失败的根源:场景复杂度与组合泛化
双向统一决策树与扩散模型于 GTSM 框架,提出两个表格算法。
将Fréchet距离直接作为生成器训练损失,只需解耦估计与梯度规模。
用物理属性图+VLM反馈把可控物理合成注入视频扩散模型
ViPO:规模化视觉偏好优化
👍 3提出 Poly-DPO 算法并构建百万级视觉偏好数据集,解决偏好优化难以规模化的问题
X-WAM:统一4D世界动作模型,联合预测多视角RGB-D视频与机器人动作
探查图像编辑模型中的视觉规划能力
👍 2把视觉规划重构为单步图像编辑任务EAR,配合AMAZE基准系统评估前沿模型的推理能力。
RvR将图像精修重构为条件再生,移除编辑指令与像素一致性约束以拓宽修改空间。
用ELBO代理扩散模型似然,把GRPO嫁接到文生图后训练上,比MDP路线快2-3倍且SOTA。