开源统一视频生成模型,融合多模态组合与推理能力,支持文本/图像/视频自由形式输入
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
PhyGenesis 通过轨迹矫正与异构训练实现物理一致的驾驶视频生成
利用图像复原扩散模型的退化感知特征实现退化视频的光流估计
用视频扩散模型将3D引擎渲染视频转化为照片级真实感视频
将触觉感知融入预测式视频世界模型,实现接触丰富操作的鲁棒控制
评估多主体图像生成中属性绑定错误的基准测试与诊断方法
将几何基础模型复用于多视角扩散
👍 48用几何基础模型的特征空间替代VAE作为多视角扩散的潜空间,实现更快更好的新视角合成
视频生成强化学习中的流形感知探索方法
👍 34通过微观精确SDE和宏观双重信任区域,使视频GRPO探索保持在数据流形附近
生成模型与编码器共享高斯隐空间,支持线性语义编辑
基于快照的广义离散扩散模型
👍 11统一框架支持任意离散扩散,首次大规模超越自回归
通过感知约束的动态缓存,将视频世界模型推理速度提升2.3倍同时保持99.4%质量
LoRA2让每个LoRA组件自适应学习最优秩,在保持生成质量的同时大幅降低内存消耗
提出基于ControlNet的两阶段伪装攻击框架,生成既欺骗检测器又对人类隐蔽的车辆伪装图案
通过关系注意力机制显式绑定人脸-属性,实现精准多主体视频定制
提出D-MMD方法将离散扩散模型蒸馏为少步生成器,在文本和图像上超越教师
EgoForge 仅凭单张自我中心图像+高层指令+可选外中心图,生成目标驱动的连贯第一人称视频
从视频生成模型提取3D先验增强MLLM空间理解
将视频编辑分解为语义锚定和运动对齐,实现高精度指令跟随和强时序一致性
提出MoTok,将运动生成解耦为离散语义规划与扩散式精细重建,实现高效可控运动生成
联合学习视频物体移除与插入,利用逆任务一致性擦除物体副作用效果