利用全局几何记忆和立体记忆两种机制,从单张图片生成多轨迹一致视频并重建高质量3D场景
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
将Sonar文本嵌入空间扩展到图像和视频,实现多模态统一的潜空间推理模型
通过奖励模型增强图像生成中的空间理解
👍 60提出专用空间奖励模型与数据集,显著提升图像生成的多对象空间关系理解能力
用解耦扩散Transformer将短视频保真度与长时序一致性分离,实现分钟级快速视频生成
用网络敏感度指导缓存决策,加速视频扩散模型推理
通过条件引导调度实现混合并行,将扩散模型推理加速2.3倍同时保持图像质量
提出CMDM框架,结合因果扩散和自回归建模,实现高质量文本到动作生成
DyaDiT生成社交感知的双人对话手势
双流MMDiT架构统一视频-音频联合生成、修复与编辑任务
统一框架同时实现参考生成、视频编辑和音频驱动动画三任务
首个多人 Minecraft 视频世界模型,支持多视角一致性生成
将图像编辑重新定义为物理状态转移,利用视频监督学习物理先验,提升编辑的物理合理性。
基于MoE架构、时序对齐RoPE和音视频DPO,实现高质量同步音视频联合生成
三模态掩码扩散模型的设计空间
👍 4首个统一文本、图像、音频的三模态掩码扩散模型,通过SDE参数化消除最优批量大小搜索
通过频谱演化感知的缓存策略,在保留内容质量的同时加速扩散模型推理
首个系统评估扩散模型在CT重建中性能的综合基准测试平台
ArtiAgent智能体框架自动合成图像伪影数据,训练VLM超越GPT-5的伪影理解能力
DODO:离散OCR扩散模型
👍 10首个利用块离散扩散实现并行解码的OCR视觉语言模型,推理速度提升5倍
提出混合2D-3D手部条件化策略,实现精细手部交互的沉浸式VR视频生成
用 LoRA 权重基底跨越视觉类比空间
👍 13提出 LoRWeB,通过可学习的 LoRA 基底和动态编码器组合,实现对未见视觉类比任务的泛化编辑。