用多模态智能体模拟真人玩家,围绕长时程目标闭环评测九个视频世界模型
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
把电影编码为可编辑的电影知识图谱,用重构残差驱动双环文本梯度自进化
首个14B级实时流式人体动画系统,19.63 FPS且3分钟质量几乎零漂移
首个流式音视频联合身份替换框架:单一扩散模型同步换脸换声,3步采样13.6 FPS
用因果教师与前缀评分对齐师生信息集,实现低延迟可控长视频生成
首个60学科专家标注的科学视频生成基准,揭示“看着逼真”不等于“机理正确”
视频生成仅作训练信号,推理时丢弃视频分支直接预测轨迹
用VLM显式推理物体诱导效果,实现高保真视频对象擦除。
统一模型实现多镜头视频生成、参考生成与编辑,单GPU达16.74FPS。
把世界动力学建模为物理时间上的潜在ODE速度场,未来预测即潜在空间积分
PhiZero:围绕物理语言构建的物理世界模型
👍 166从野外视频自监督学习离散'物理语言',先推理后渲染的物理世界模型。
用可执行 Blender 代码充当过程级思维链,双引擎系统生成物理一致视频。
通过反向KL分解,把演化上下文作为在线监督信号注入蒸馏目标。
用分布对齐视角重做自回归视频蒸馏,联合DMD与CD损失。
提出TriLayer三元组数据集与双分支扩散框架,实现视频物体的显式分层插入与分解。
面向快速图像与视频生成的并行解码蒸馏
👍 14训练并行解码器,用单次前向同时预测多个去噪步的速度,实现少步、高质、高多样性的扩散与流模型蒸馏。
重新审视策略内扩散蒸馏中的无分类器引导
👍 75揭示CFG组合OPD的分支歧义缺陷,提出分支感知的PDM目标稳定跨尺度蒸馏
将动态路由、稀疏计算与近似校正统一到单次在线softmax中的免训练稀疏注意力
ID-V2V:保持身份的视频重新风格化
👍 10把身份保持建模为视频重打光,用重打光人脸+法线+关键帧+深度联合控制,实现关键帧编辑的逐帧扩散传播。
混合线性与softmax注意力,单卡生成比全softmax视频DiT快3.2倍