用VGGT编码最近16帧历史,注入VLA以解决块间意图冲突。
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
首个无视觉编码器与VAE的端到端统一多模态原生架构,在32倍压缩比下同时比肩顶级理解与生成模型。
ELF:嵌入式语言流
👍 15连续扩散语言模型,在嵌入空间全程去噪、仅末步离散化
首个将OPD引入Flow Matching T2I的多任务对齐框架
TextLDM:基于连续潜扩散的语言建模
👍 26把视觉DiT配方原封搬到语言建模,REPA塑造潜空间后比肩GPT-2
Tuna-2:像素嵌入像素空间统一多模态,端到端无VAE/编码器达SOTA。
把VLM做高层规划、DiT做低层控制,用级联交叉注意力桥接视觉定位与动作。
首个通过Bregman散度Flow Matching匹配离散扩散性能的连续扩散语言模型
首个同时融合文本/参考图/音频/姿态四模态的HOIVG统一生成框架。
反向扩展视频生成器为基座,用统一流匹配统一视频生成与理解
用条件与无条件高斯的线性混合源分布,拉直生成轨迹并显著提升 Rectified Flow 采样效率。
双分支 flow matching 视频生成模型,联合建模视觉与 V-JEPA2 物理潜变量
将深度生成、视频想象与运动规划统一在LLM+三专家框架中。
将轨迹重建重新定义为地图视觉视频生成任务,用视频模型直接在地图上绘制连续GPS路径
将文生图的推理与生成统一为MDP,用GRPO联合优化文本和图像策略
基于聚类的最优传输流匹配方法
👍 2通过聚类和簇内最优传输,实现更直的流匹配轨迹,提升生成质量
通过引入语义航点解耦噪声到像素的生成路径,解决像素空间 Flow Matching 的轨迹冲突问题
通过解耦高频细节与语义特征,在单一模型中实现视觉理解与图像生成的统一优化
层次化去噪替代逐块生成,实现高质量长视频
绕过扩散LLM不可计算的似然,用速度场整流实现精准对齐