用 Noisy ViT 编码器统一视觉空间,解耦扩散解码器与文本解码,实现理解与生成的协同提升。
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
从冻结扩散Transformer提取多模态感知信息
用"相机栅格视频"作为视觉化的相机表征,实现无需跨配对数据的多镜头相机运动克隆。
像素对齐多层几何表示,同时实现可见表面重建与遮挡几何生成。
首个系统量化视频世界模型长程记忆能力的多维基准
异步帧调度让关键帧走完去噪、非关键帧跳步,配合潜轨迹投影保时序一致性
用视频参考+稀疏注意力+动作表征实现生产级1080p数字人视频生成
首个仅用2D监督训练3D人体动作扩散模型,性能接近全3D监督
将8步扩散模型蒸馏为2步生成器,通过三种技术突破2步生成的质量和稳定性瓶颈
通过随机令牌掩码减少表示对齐对完整令牌集的依赖,加速扩散模型训练
提出端到端角色动画范式,统一多种子任务,通过MotionPair-60K数据集和Bias-Aware DPO实现业界领先性能
首个支持实时推理的唇形同步扩散模型,通过分析驱动的蒸馏框架将14B教师压缩为两步自回归学生,实现31 FPS流式生成
通过分层token化和粗到细rollout实现长视频生成的一致性
视频世界模型的潜在空间记忆
👍 71在潜在空间直接构建3D记忆,实现高效几何一致的视频生成
文生图模型只需词义和词序,无需复杂上下文信息
基于分解视觉代理的直接3D感知物体插入
👍 26提出DIRECT框架,通过外观-几何-上下文三元引导实现姿态可控的物体插入
发现2步推理比50步推理物理一致性更好,提出PhaseLock保留运动先验
通过基于熵的梯度缩放在音乐扩散模型中实现结构化多样性生成
时间块扩散视觉语言动作模型
👍 2提出TBD-VLA,结合时间自回归与并行解码的块离散扩散VLA框架。
5B参数的高效统一视频生成编辑框架,推理速度提升5.4倍