首个将物理碰撞规则直接编码到高维空间的强化学习视频生成框架。
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
三阶段解耦物理推理与视觉合成的免训练视频生成框架
基于MMDiT的实时流式人形视频生成框架,25fps低延迟交互,支持任意时长
基于转移匹配蒸馏的快速视频生成方法
👍 34提出TMD框架,将大型视频扩散模型蒸馏为少步高效生成器
利用VJEPA-2世界模型奖励信号在推理时引导视频生成以提升物理真实性
SRENDER通过生成稀疏关键帧和3D渲染,将相机控制视频生成加速40倍以上
视频生成中的运动归因:MOTIVE框架
👍 72提出MOTIVE框架,通过运动加权梯度归因识别影响视频生成运动质量的训练片段。
首个面向自动驾驶世界模型的综合基准,覆盖视觉真实性、轨迹合理性、时间一致性和可控性四大维度
首个大规模VAR视频生成框架,多尺度下一帧自回归,13倍加速推理
目标力:教会视频模型完成物理条件化的目标
👍 16通过目标力向量条件化视频生成,让模型学会规划因果物理链来达成指定效果。
通过视觉身份提示和多视角视频生成增强机器人操作数据
提出4D几何控制表示,统一控制相机和多物体运动,生成高保真动态视频
首个引入时空记忆机制的相机控制视频重渲染框架,实现多视图场景的一致性生成
ReHyAt通过混合注意力将视频生成复杂度从二次降为线性。
通过低成本微调将预训练视频扩散模型转化为金字塔模型,实现4.5倍FLOPs降低且无质量损失
单一框架统一图像视频生成编辑的多模态扩散模型
一种可扩展的4D世界建模方法,支持从单目视频进行重建、新轨迹视频生成和多种下游应用
按去噪阶段重要性分配大/小模型,实现1.65×加速且保持质量
提出3D物体流作为通用中间接口,将视频生成模型的视觉预测转化为机器人可执行动作,实现零样本开放世界操作
提出轻量级历史嵌入,通过两阶段学习在自回归视频生成中保持一致性