三段式KV缓存压缩策略,5秒训练生成120秒长视频
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
用独立LoRA在并行画布上训练13种音视频控制模态,仅需55K步即可超越VACE等基线
运动脉搏:从视觉动力学测量物理帧率
👍 20提出Visual Chronometer预测视频物理帧率,解决时间尺度幻觉
通过动态混合精度量化与时间增量缓存,实现视频DiT 1.92倍加速和3.32倍内存缩减
开源统一视频生成模型,融合多模态组合与推理能力,支持文本/图像/视频自由形式输入
PhyGenesis 通过轨迹矫正与异构训练实现物理一致的驾驶视频生成
从《怪物猎人:荒野》采集的1亿帧游戏数据集,支持动作条件世界建模
用视频扩散模型将3D引擎渲染视频转化为照片级真实感视频
从视频历史轨迹预测未来密集运动轨迹的生成框架
提出14B参数物理对齐世界模型,生成符合物理定律的机器人操作视频
首个以交互为中心的视频世界模型评测基准,揭示当前模型在因果一致性和物理交互上的核心短板。
以简驭繁:面向快速音视频生成的单流架构基础模型
👍 125daVinci-MagiHuman单流架构实现高效音视频同步生成
视频生成强化学习中的流形感知探索方法
👍 34通过微观精确SDE和宏观双重信任区域,使视频GRPO探索保持在数据流形附近
通过感知约束的动态缓存,将视频世界模型推理速度提升2.3倍同时保持99.4%质量
高效RL框架对齐蒸馏视频模型与人类偏好
通过关系注意力机制显式绑定人脸-属性,实现精准多主体视频定制
无需训练的视频内容、动作与动态多样化编辑
👍 18DynaEdit:免训练视频编辑方法,支持修改动作、插入交互物体、改变全局效果
EgoForge 仅凭单张自我中心图像+高层指令+可选外中心图,生成目标驱动的连贯第一人称视频
融合显式3D与隐式注意力的Patch级混合空间记忆机制
揭秘视频推理:扩散模型中的推理机制
👍 373视频扩散模型的推理沿去噪步骤展开,而非跨帧进行