基于时空上下文学习的通用角色动画框架
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
通过理论分析揭示数据维度决定扩散模型最优预测目标,提出可学习框架k-Diff自动优化
通过多头RoPE抖动解决自回归视频生成中的注意力坍塌问题,首次实现12小时连续流式视频生成
基于像素均值流的单步无潜变量图像生成
👍 18提出pMF方法实现单步无潜变量图像生成,ImageNet 256×256达2.22 FID
用单一音视频扩散模型+LoRA实现高质量多语言视频配音
推进开源世界模型
👍 135开源世界模型LingBot-World,支持分钟级实时交互世界模拟
通过知识蒸馏将VLA模型从18层压缩到6层,实现2倍推理加速且精度损失<1%
用2σ(1.6x)-1替换tanh,使FSQ同时实现100%利用率和最优精度
利用预训练视频生成器作为自改进器,通过预测-扰动循环提升视频物理真实性和运动连贯性
基于扩散Transformer的统一多模态视频生成框架
从状态构建和动力学建模两个维度,系统梳理视频生成模型迈向世界模拟器的技术路径
通过渐进式对应感知对齐实现免训练的纹理3D形变生成
记忆增强框架解决多轮视频编辑的跨轮一致性问题
SALAD在视频扩散变换器中引入并行线性注意力分支,实现90%稀疏度和1.52-2.03倍推理加速,同时保持生成质量。
RAE 用高维语义空间替代 VAE 低维压缩,让扩散模型收敛更快、生成更好且更抗过拟合
扩散模型将粗糙分割掩码转为高质量视频alpha抠图
将预训练视频模型单阶段微调为机器人策略,无需架构修改即可实现SOTA操控性能
OmniTransfer:三模块统一框架实现多任务时空视频迁移
双分支架构解耦理解与生成,跨模态自注意力实现协同胸部X光分析
提出解绑-重绑机制实现任意数量、类型、空间布局的角色动画