提出细粒度属性解耦的CPO方法,将扩散模型从粗粒度二元偏好对齐提升到多维、离散、非均衡的专家评价标准
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
系统研究3D生成模型如何记忆训练数据,并提出减少记忆化的实用策略
通过合并低熵去噪步骤为高熵SDE步骤,提升流模型GRPO训练效率
LTX-2:高效联合音视频基础模型
👍 183首个开源高效音视频联合生成模型
首个支持文本/风格图/首帧三种引导方式的统一视频风格化框架
通过音频-表情扩散模型的个性化重建误差实现自监督人脸伪造检测
通过门控自适应正则化和多样性感知优化,解决扩散模型RL微调中的奖励作弊问题
单一框架统一图像视频生成编辑的多模态扩散模型
首个RL框架实现文本指导物体平移、旋转、缩放
用扩散模型生成密集像素-表面对应,实现高精度多视角人体网格恢复
基于扩散forcing的实时交互式头像生成框架,实现低延迟双向对话模拟
提出两阶段框架D²-Align,通过在奖励嵌入空间学习方向向量来纠正奖励信号,缓解RLHF过程中的多样性坍塌问题
将多模态推理重新定义为图像到图像生成任务,在长时程视觉推理任务上显著超越SOTA MLLMs,实现了高效、可控、并行且可协作的推理范式
离散性在扩散大语言模型中的作用
👍 18分析扩散语言模型的理论框架,揭示连续与离散方法的结构性权衡
按去噪阶段重要性分配大/小模型,实现1.65×加速且保持质量
通过多视图外补而非新视角生成,高效实现稀疏视图3D重建
首个实现相机运动与时间序列完全解耦的视频扩散模型,支持从单目视频生成自由时空探索的新视角视频。
通过引入中间层监督和内部引导机制,显著提升扩散Transformer的生成质量和训练效率