通过物理仿真桥接3D动作与视频生成,实现实时交互
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
利用VGGT内部语义和几何先验,无需相机位姿即可实现室内3D检测
利用全局几何记忆和立体记忆两种机制,从单张图片生成多轨迹一致视频并重建高质量3D场景
首个雌性萨能奶山羊物种专属参数化3D模型与单视图自动体尺测量框架
通过测试时训练将二次方复杂度的全局注意力压缩为线性MLP,实现千张图像秒级重建
利用TTT层实现线性复杂度的长上下文自回归3D高斯重建
提出统一前馈框架,从单目视频联合重建4D几何与运动
用局部点云记忆替代全局3D重建,实现长时域相机可控视频生成的世界一致性
利用视频扩散模型从单目视频同时重建4D几何和场景流
通过异质性感知加速将SAM3D推理速度提升2.67倍,保持几何保真度
提出三角形-高斯混合表示,实现流式3D重建中几何精度与渲染质量的解耦优化
多模态整流流模型从随意拍摄序列生成鲁棒的度量3D物体形状
V-DPM:基于动态点图的4D视频重建
👍 11将动态点图扩展到视频级多视角,实现单次前向传播的4D场景重建
SRENDER通过生成稀疏关键帧和3D渲染,将相机控制视频生成加速40倍以上
提出滚动内存机制实现无限长度在线3D几何重建
通过多视图外补而非新视角生成,高效实现稀疏视图3D重建