两阶段对齐+双重一致性,无需训练实现无限帧长视频生成
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
扩散模型对齐的缝合价值模型
👍 12通过缝合技术将像素空间奖励模型高效转移到噪声潜在空间,实现快速准确的扩散对齐
证明原生DiT加x-prediction在DINOv2表征空间即可达图像生成SOTA
通过显式建模Z-order遮挡关系,解决布局到图像生成中物体重叠区域的纹理混淆问题
结合文本与手绘火柴人/轨迹双条件,用扩散模型生成可控 3D 人体动作
把VLM训练成导演理解分镜创意意图,再统一控制信号注入视频生成
工具增强VLM智能体+统一视频DiT,解决视频编辑请求欠指定难题
用可控扩散模型联合生成城市卫星图与建筑能耗/高度图。
构建首个开源 100MP T2I 数据集,探索原生超高分辨率图像生成训练方案
视频模型可通过可验证奖励进行推理
👍 11VideoRLVR框架用可验证奖励优化视频模型,提升规则验证任务的推理能力
DiHAL用几何特征定位扩散友好层,通过重建隐藏状态提升扩散语言模型性能
首个用自然语言同时控制多个实体的可交互视频世界模型,支持跨实体动作迁移与开放词汇
实时交互式人体服装视频定制,23.8 FPS 单卡推理
单步训练视频扩散GRPO,6倍加速且匹配全轨迹性能。
用检查表引导的自训练规划器+VLM奖励驱动的工具编排器,解决抽象长程图像编辑难题
用潜空间整流流把变化检测重构为掩膜生成,刷新四项基准 SOTA。
解耦可迁移动作与具身外观的跨具身视频生成,仅用未配对视频即可适配新机器人。
2.6B参数高效分钟级720p相机控制世界模型,单卡可部署
把相机诱导的 warp 塞进视频模型的原生历史通路,零样本激活相机跟随行为。
用域迁移适配器把视觉域(真实/合成)与控制信号解耦,让扩散模型在合成 3D 数据上学到 3D 一致性,同时保住真实感。