OGPP:用轨道规范化+索引嵌入+几何路径统一粒子生成的对称性与属性编码
Sinan Wang, Jinjin He, Shenyifan Lu, Ruicheng Wang, Greg Turk, Bo Zhu
2026-05-05
几何深度学习
流匹配
生成模型
粒子系统
计算机图形学
RvR将图像精修重构为条件再生,移除编辑指令与像素一致性约束以拓宽修改空间。
Jiayi Guo, Linqing Wang, Jiangshan Wang, Yang Yue, Zeyu Liu, Zhiyuan Zhao,...
2026-04-29
扩散模型
文生图精修
条件图像生成
流匹配
统一多模态模型
双模式权重共享自演化框架,仅4-8步采样即可实时流式生成音视频
Yupeng Zhou, Lianghua Huang, Zhifan Wu, Jiabao Wang, Yupeng Shi, Biao Jiang,...
2026-04-29
流匹配
流式生成
自回归扩散
自蒸馏加速
音视频联合生成
用ELBO代理扩散模型似然,把GRPO嫁接到文生图后训练上,比MDP路线快2-3倍且SOTA。
Bingda Tang, Yuhui Zhang, Xiaohan Wang, Jiayuan Mao, Ludwig Schmidt, Serena...
2026-04-29
ELBO
GRPO
RLHF
在线强化学习
扩散模型
CoReDi:让语义投影与扩散模型联合训练,稳定共演化提升生成质量。
Theodoros Kouzelis, Spyros Gidaris, Nikos Komodakis
2026-04-24
ImageNet
图像生成
扩散模型
流匹配
特征坍塌
用视觉隐空间世界模型给VLA加上前瞻规划,实现工业机械臂零人工干预
Adriana Aida, Walida Amer, Katarina Bankovic, Dhruv Behl, Fabian Busch,...
2026-04-23
世界模型
工业部署
机器人操作
流匹配
视觉-语言-动作模型
两步跳跃轨迹+梯度折扣+相似度加权,让 FLUX 等流匹配模型能稳定训练任意早期步。
Zhanhao Liang, Tao Yang, Jie Wu, Chengjian Feng, Liang Zheng
2026-04-17
RLHF
人类偏好对齐
图像生成
流匹配
直接梯度法
用朗之万恒等映射统一扩散模型的VAE/score/flow三大视角
Candi Zheng, Yuan Lan
2026-04-15
VAE
得分匹配
扩散模型
教学博文
朗之万动力学
APEX:用条件空间仿射偏移在流匹配模型内生构造对抗信号,实现无判别器的高保真一步生成。
Deyuan Liu, Peng Sun, Yansen Han, Zhenglin Cheng, Chuyan Chen, Tao Lin
2026-04-15
LoRA蒸馏
一步生成
文生图
条件偏移
流匹配
在导数空间用对抗目标训练连续流模型,仅10个epoch后训练即大幅降低FID
Shanchuan Lin, Ceyuan Yang, Zhijie Lin, Hao Chen, Haoqi Fan
2026-04-14
后训练
图像生成
对抗训练
扩散模型
概率流ODE
通过两阶段框架学习 64× 时间压缩的稠密运动潜空间,使目标条件运动生成比视频模型快 4 个数量级。
Nick Stracke, Kolja Bauer, Stefan Andreas Baumann, Miguel Angel Bautista,...
2026-04-14
世界模型
流匹配
潜空间学习
目标条件生成
运动生成
用多奖励 Langevin 动力学 + 提示感知自适应策略,在推理时免训练、免反演地引导扩散/流匹配模型
Onkar Susladkar, Dong-Hwan Jang, Tushar Prakash, Adheesh Juvekar, Vedant...
2026-04-10
Langevin 动力学
SAM2
可微分 VQA
图像编辑
奖励引导
将多模态生成重构为视觉流匹配,用图像入图像出范式统一文生图、编辑与物理指令任务。
Junchao Yi, Rui Zhao, Jiahao Tang, Weixian Lei, Linjie Li, Qisheng Su,...
2026-04-09
图像编辑
多模态生成
数据集
流匹配
视觉中心
Sony AI 发布音效基础模型,集成音频编解码、文本对齐、文本到音频与视频到音频扩散生成
Gaëtan Hadjeres, Marc Ferras, Khaled Koutini, Benno Weck, Alexandre Bittar,...
2026-04-03
CLAP
多模态生成
流匹配
潜在扩散模型
视频到音频
基于流匹配的无边界3D世界生成方法,支持高质量几何结构和纹理生成
Amogh Joshi, Julian Ost, Felix Heide
2026-04-01
3D生成
体素表示
可控生成
无边界场景
流匹配
提出分层多尺度补丁transformer架构,将计算成本降低50%同时保持高质量生成
Quan Dao, Dimitris Metaxas
2026-04-01
Transformer
多尺度建模
扩散模型
流匹配
高效生成
提出UMF框架,通过P-Flow和S-Flow实现任意人数的文本生成动作
Guanhe Huang, Oya Celiktutan
2026-03-31
动作合成
多人生成
文本生成动作
流匹配
自回归生成
仅需3秒参考音频即可克隆声音的多语言TTS,超越ElevenLabs
Alexander H. Liu, Alexis Tacnet, Andy Ehrenberg, Andy Lo, Chen-Yo Sun,...
2026-03-27
多语言
文本转语音
流匹配
直接偏好优化
语音克隆
通过微观精确SDE和宏观双重信任区域,使视频GRPO探索保持在数据流形附近
Mingzhe Zheng, Weijie Kong, Yue Wu, Dengyang Jiang, Yue Ma, Xuanhua He, Bin...
2026-03-24
GRPO
强化学习对齐
扩散模型
流匹配
视频生成
将Hamilton-Jacobi可达性与流匹配结合,实现离线安全强化学习的单步高效策略
Mumuksh Tayal, Manan Tayal, Ravi Prakash
2026-03-24
Hamilton-Jacobi可达性
共形预测
安全强化学习
流匹配
离线强化学习