通过Horizon-Aware Schedule将流式VLA即时动作采样加速10倍
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
首次在原生3D空间实现骨架精确控制的轻量级生成框架
提出基于黎曼几何的运动生成框架,在流形上建模并通过流匹配学习动力学
通过增强条件空间构建多视角奖励映射,提升流模型GRPO对齐效果
通过解耦学习目标与双分支流水线,实现既学得新概念又不破坏原模型行为的概念定制。
用变分框架联合训练噪声适配器与流映射,让 Flow Map 在一步生成中实现条件采样。
将传输模型条件化在源/目标分布的嵌入上,实现跨分布泛化与半监督传输
把 CFG 重写为控制律,提出滑模控制 SMC-CFG 解决高引导尺度下的振荡失稳
提出COMiT,通过迭代局部观测和递归更新构建具有语义结构的离散视觉token序列
用连续流匹配在one-hot空间上训练语言模型,并以二时去噪器蒸馏出一步生成器,击败离散扩散。
学习动作分块流策略的原生延续机制
👍 3通过训练时重塑流动力学,实现动作分块VLA模型的原生连续执行
无需训练框架,在极端视角变化下实现4D视频重光照
黎曼流匹配+雅可比正则化,解决扩散Transformer在表征空间收敛失败的几何问题
稳定速度场:从方差视角理解流匹配
👍 3通过方差分析揭示流匹配的双区间结构,提出无偏降方差训练和免微调加速采样
通过耦合配对时间步的速度预测,降低流匹配训练方差并提升采样效率
用逐步密集奖励和自适应噪声校准改进流匹配模型的人类偏好对齐
基于流的极值数学结构发现
👍 2FlowBoost:用流匹配+强化学习自动发现极值几何配置
双脑架构冻结左脑保通用、训练右脑做控制,用 AsyMoT 机制融合语义与动作
多模态整流流模型从随意拍摄序列生成鲁棒的度量3D物体形状
按去噪阶段重要性分配大/小模型,实现1.65×加速且保持质量