让VLA逐块流式生成动作并实时注入触觉反馈,消除执行中的触觉时间错配
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
用语义RGBA图层作为生成、理解与编辑的原子单元。
用DINOv3语义表示从未来预测和历史检索双向增强WAM的操作鲁棒性。
用分布对齐视角重做自回归视频蒸馏,联合DMD与CD损失。
用树状层级潜变量实现粗到细推理,兼顾多步规划与低延迟流式生成。
用208M图、约40万美元训出的开源多模态生成系统,靠'理解优先'追平闭源。
用混合专家架构把世界动作模型推理延迟降到85毫秒。
用第一人称视频预训练 + 真机后训练 + DAgger,构建可控双臂灵巧操作系统。
基于几何感知预训练的上下文全景生成
👍 20提出Canvas360两阶段框架,通过深度辅助预训练和统一微调实现高质量全景图像生成
通过分布级奖励优化视觉生成模型
👍 16提出分布级奖励框架解决样本级RL的reward hacking问题,显著提升生成质量
将RLHF和OPD应用于扩散模型,提升图像生成与编辑质量
DanceOPD:在线策略生成场蒸馏
👍 81通过硬路由和单查询场匹配,实现多能力图像生成模型的统一蒸馏
用检索取代微调,测试时零参数更新扩展VLA到新任务
腾讯 Robotics X 提出端到端 VLA 栈:10K小时UMI数据+4B MoT VLM+FlowPRO离线RL,跨形态零遥操作部署。
揭示Rectified Flow模型在插值路径上存在可被利用的成员推断泄露风险
完全基于仿真数据训练的人形机器人操作策略,实现零样本真实部署且效果超越真实遥操作数据
dots.tts 技术报告
👍 16首个20亿参数的连续自回归TTS基础模型,解决长序列误差累积问题,达到开源SOTA性能
Retinex 插值连续伪配对 + 边缘加权 Flow Matching,实现可控低光增强。
用Sobolev空间着色噪声先验+对抗负样本生成,弥合扩散SR与自然图像频谱差距。
把少步图像生成全程搬进球面隐空间,省去反复的像素-隐空间切换。