用局部点云记忆替代全局3D重建,实现长时域相机可控视频生成的世界一致性
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
提出视频扩散模型PISCO,用稀疏关键帧控制实现精确的视频物体插入
通过推理时剪枝不稳定token消除长视频生成中的时序漂移
通过动力学增强的潜在动力学模型,从无标签视频学习可迁移任务知识
首个开放域闭环世界模型基准,评测记忆一致性与动作控制
MOVA:迈向可扩展且同步的视频-音频生成
👍 15932B参数非对称双塔架构,实现高保真唇形同步与音视频对齐的开源联合生成模型
用RL后训练大幅提升视频世界模型的动作跟随精度和视觉质量
仅用5秒视频训练,测试时可生成长达30分钟的高质量自回归视频
利用视频扩散模型从单目视频同时重建4D几何和场景流
用44k小时人类视频预训练机器人世界模型,实现零样本泛化
用长上下文教师指导长上下文学生,解决视频生成遗忘-漂移困境
面向文本-图像到视频(TI2V)生成的推理能力基准测试,评估模型对隐式世界规则的理解
提出分层无姿态记忆压缩器,实现1000帧连续世界模拟
视频生成模型不仅是媒体工具,更是可扩展、可泛化的视觉推理范式
用首帧锚定采样轨迹,免训练稳定自回归长视频生成
自适应一维视频扩散自编码器
👍 5用 Transformer 替代 CNN 做视频压缩,支持自适应长度编码和扩散解码
首个专为自回归视频扩散设计的稀疏注意力方案,实现2-3倍加速且质量无损
通过滑动窗口运动提取和梯度复用,实现无训练视频运动转移加速3.4倍
通过语义感知平滑与渐进残差量化,实现7倍KV缓存压缩的自回归长视频生成
利用虚拟头实现高效自回归视频扩散
👍 8通过识别并压缩注意力中的虚拟头实现自回归视频扩散模型的无损加速