提出原生离散扩散VLA模型,统一多模态理解与生成,实现机器人长视距精准控制
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
基于掩码离散扩散模型的单细胞转录组生成框架,实现细胞状态模拟和扰动响应预测
潜在空间几何引导的4D世界一致性视频生成框架
Extend3D:城镇规模3D场景生成
👍 26无需训练的单图像到城镇规模3D场景生成方法,通过扩展潜在空间和重叠块式流实现高保真度。
RawGen:学习相机原始图像生成
👍 21首个基于扩散模型的文本到raw图像生成框架,支持任意目标相机
首个基于掩码扩散的8B全模态统一模型,在单一架构中实现文本、图像、语音、视频的任意理解与生成
用扩散模型生成 50 万带 3D 网格标注的合成人体图像。
基于全景表示和预览-精炼两阶段设计的可控长视野全景视频生成框架
提出分层多尺度补丁transformer架构,将计算成本降低50%同时保持高质量生成
系统综述视频生成模型作为世界模拟器时的效率优化技术,涵盖建模范式、架构设计和推理算法三个维度。
通过在DiT的上下文空间中应用排斥力,在保持质量的同时显著提升文本到图像生成的多样性。
0.39B参数统一扩散模型,在手机端实现<1秒图文生成与编辑
HandX:可扩展的双手机动与交互生成
👍 12大规模双手机动数据集与生成框架,支持精细手指协同与接触交互
通过提取VLM扩散模型中间层特征注入3D生成,实现背面语义可控
用扩散 Transformer 直接生成分割 mask,一步推理,达到 SOTA
PixelSmile:迈向精细面部表情编辑
👍 118通过连续情感标注和对称对比学习实现精细可控的面部表情编辑
仅调约102个缩放参数,用进化策略校准 DiT 各模块权重,即可显著提升生成质量并加速推理
利用大规模图像编辑模型的强先验知识,通过高质量数据生成与两阶段训练实现真实世界图像复原
REPA在像素空间扩散模型中失败,PixelREPA通过掩码Transformer适配器解决
通过动态混合精度量化与时间增量缓存,实现视频DiT 1.92倍加速和3.32倍内存缩减