用持久的世界状态寄存器让多智能体视频世界模型保持跨视角一致性
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
自梯度强制:原生长视频外推
👍 34两阶段训练修复自生成历史KV缓存写入的梯度缺口,让5秒训练窗口外推到数分钟视频
训练免修的稀疏注意力系统,用P2P头部迁移和空闲补偿消除多GPU视频生成的负载不均
键盘可控、单卡实时的视频世界模型,可连续推演数十小时
基于15B扩散Transformer的交互式长时程世界模型,蒸馏至4步实现低延迟生成
用像素空间掩码轨迹作为视频模型动作接口,单模型兼顾正/逆世界模型。
首个将视频物理推理锚定到物理定律并分阶段诊断的基准
用可学习规划Token与分数旋转位置编码实现帧级可控多镜头视频生成
用冻结视频基础模型做编码器,统一支持连续与离散视频生成,收敛快5倍。
以游戏引擎的动作-状态-观测循环为框架重审交互式世界模型,并发布90小时悟空数据集
视频 = 世界 + 事件流
👍 21Wan-Streamer v0.3 将视频分解为世界与事件流,实现通用预训练可迁移的实时音视频交互。
首个无需训练、无需骨架先验的跨物种视频动作迁移框架
视频生成模型是通用视觉学习器
👍 78利用预训练视频生成模型构建统一通用的多任务视觉感知框架
Vidu S1:实时交互式视频生成模型
👍 134支持语音控制的实时交互式数字人物视频生成系统
OpenCoF:通过视频生成学习推理
👍 23构建OpenCoF-17K数据集,通过多样化时间监督和推理token机制提升视频生成模型的推理能力
首个开源MoE视频基础模型,通过稀疏专家架构、机器人增强数据和多维奖励系统实现物理世界的精确模拟。
首个支持720p@60fps实时交互的开放式无限世界模型
OPSD-V通过真实长视频上下文进行缓存感知的在线策略自蒸馏,提升少步自回归视频生成的长视距稳定性
融合LLM规划器和VLM批评者,将视频生成器转化为任务感知的世界模型,显著提升长周期机器人操作性能
同步生成RGB、深度和光流的4D世界模型,实现高精度机器人操作