提出解耦记忆架构实现分钟级一致长视频生成
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
训练时用轻量生成器,推理时用UPFB桥接大生成器,实现高质量视频生成
通过联合DMD和对抗损失实现高质量单步自回归视频生成
全栈框架将视频基础模型转为实时相机可控世界模型
YoCausal评估视频扩散模型的因果理解,发现时间箭头感知不等同于因果认知
用自适应状态替换静态锚点,解决流式视频生成中的动态性抑制问题
通过多关键帧条件控制,实现电影风格视频的精确叙事生成
提出Simplex旋转编码和稀疏Hub注意力,实现可扩展至四个玩家的多智能体世界模型
通过稀疏注意力、序列并行、量化和强化学习,实现高质量视频生成的1.64倍加速
首个闭环视频世界模拟器,支持状态预测和奖励评估
用多智能体+双桥一致性框架在百镜头量级实现角色一致的长视频换脸/风格化重制
一种通过潜在空间记忆传播和恢复流匹配实现分钟级稳定人体动画的轻量级后训练框架
WBench用289案例×5维度×22指标,对20款SOTA交互式世界模型做统一评测。
用显式 3D 缓存解耦几何与纹理,让扩散模型沿任意相机轨迹生成时空一致的 360° 视频。
用Bradley-Terry判别器+前向流匹配,把黑盒视频教师蒸馏进自回归学生。
用干预式基准诊断视频生成模型是否真正理解物理规律。
用VLM推理补全稀疏轨迹,生成符合物理常识的视频。
首个利用视频生成模型主动合成评测场景的MLLM时空推理基准,揭示当前模型从感知到高阶推理的性能鸿沟
SCOPE 用按像素时序条件化把 FPS 动作的局部分析与全局稳定解耦
首个用强化学习做相机控制视频重拍的框架,用度量3D评估器约束相机轨迹精度。