通过联合建模多源世界知识(运动、语义、几何),实现物理一致的视频生成。
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
通过物理仿真桥接3D动作与视频生成,实现实时交互
Helios:真正的实时长视频生成模型
👍 190首个在单H100上以19.5 FPS运行的14B视频生成模型,支持分钟级长视频
通过位置注入和多角色转换建模实现长叙事视频生成
统一DiT框架编排身体/面部/手部异构运动,实现高保真跨身份角色动画
利用全局几何记忆和立体记忆两种机制,从单张图片生成多轨迹一致视频并重建高质量3D场景
首次提出“微观世界仿真”概念,构建专家审核的显微视频基准、9.6K 数据集与微调模型。
用解耦扩散Transformer将短视频保真度与长时序一致性分离,实现分钟级快速视频生成
用网络敏感度指导缓存决策,加速视频扩散模型推理
一致性三位一体:定义通用世界模型的核心原则
👍 203提出模态/空间/时间三维一致性框架及CoW-Bench基准,系统评估世界模型的物理模拟能力
双流MMDiT架构统一视频-音频联合生成、修复与编辑任务
首个多人 Minecraft 视频世界模型,支持多视角一致性生成
通过频谱演化感知的缓存策略,在保留内容质量的同时加速扩散模型推理
首个统一评估视频基础模型理解、生成、编辑和重构能力的综合基准
超大规模视频推理套件
👍 526首个百万级视频推理数据集VBVR,含200任务与可验证评测框架
提出混合2D-3D手部条件化策略,实现精细手部交互的沉浸式VR视频生成
统一潜变量(UL):如何训练你的潜变量
👍 62联合训练扩散先验和解码器学习潜变量表示,实现高效生成
可学习路由+QAT优化稀疏线性注意力,97%稀疏下18.6倍加速
基于自适应匹配蒸馏的少步生成优化
👍 9通过奖励感知的自适应梯度调制,解决分布匹配蒸馏中的「禁区」塌陷问题
提出ViewRope几何感知位置编码,解决视频世界模型在相机循环闭合时的空间不一致问题