隐式3D运动表征实现视角解耦的可控人体视频生成
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
LIVE:长时域交互式视频世界建模
👍 13通过循环一致性目标约束误差累积,实现稳定长时域视频生成
通过时序KV压缩和ANN稀疏注意力实现5-10倍加速的自回归视频生成
用自回归教师做ODE初始化,解决双向→自回归蒸馏中的帧级非单射性问题,显著提升视频质量。
通过最优传输对齐文本-视频嵌入空间,实现无需人工标注的视频生成后训练
64×64×4高压缩VAE+层记忆DIT,实现42倍加速的图像转视频
双流DiT框架解耦感知规划与视频合成,实现文本驱动的人-物交互
基于时空上下文学习的通用角色动画框架
通过多头RoPE抖动解决自回归视频生成中的注意力坍塌问题,首次实现12小时连续流式视频生成
提出概念解耦的视频基准,定量评估世界模型对物理常数和直觉物理的理解
推进开源世界模型
👍 135开源世界模型LingBot-World,支持分钟级实时交互世界模拟
三智能体框架将粗粒度对话自动转化为电影级长视频
利用预训练视频生成器作为自改进器,通过预测-扰动循环提升视频物理真实性和运动连贯性
基于扩散Transformer的统一多模态视频生成框架
从状态构建和动力学建模两个维度,系统梳理视频生成模型迈向世界模拟器的技术路径
SALAD在视频扩散变换器中引入并行线性注意力分支,实现90%稀疏度和1.52-2.03倍推理加速,同时保持生成质量。
重新思考面向具身世界的视频生成模型
👍 46提出机器人视频生成基准RBench与大规模数据集RoVid-X
OmniTransfer:三模块统一框架实现多任务时空视频迁移
提出解绑-重绑机制实现任意数量、类型、空间布局的角色动画
未来光流预测提升机器人控制与视频生成
👍 19统一VLM-Diffusion架构从网络视频学习语言驱动的未来光流预测,赋能机器人操控和视频生成