首例测试时对抗补丁攻击流匹配VLA,仅攻击首步去噪即近乎100%攻破π0
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
用层次化JEPA编码器与像素空间流匹配,打造CPU实时可运行的音乐协作智能体
用高容量、可解码的连续文本潜变量桥接扩散生成与离散解码
轻量可复现的流式视频世界模型框架,单机8卡数日即可从零训练
单一模型同时支持自然语言设计声音与参考音频克隆声音的多模态语音音频生成系统
用布朗桥桥接+异构蒸馏实现1步200FPS实时说话人头生成。
仅用一张RGB图与指令,从冻结视频扩散中间特征直接读出6-DoF物体轨迹。
0.9B小模型自引导预测未来状态并注入几何监督,登顶LIBERO与LIBERO-Plus
基于流匹配的两阶段图像到网格框架,中位6秒生成紧凑可用的艺术家网格
首个大规模触觉原生世界-动作模型,联合预测视觉、触觉与动作
在VLA预测失败时用RL策略组合式引导动作流,OOD任务成功率最高提升17.3%
πR²:反应式实时流匹配策略
👍 4让大规模VLA流匹配策略实时闭环,重规划提速约4倍,成功率提升最高30%
用高保真手持采集替代遥操作,实现零机器人数据的策略训练与直接部署
单一解码器模型实现15种模态间的任意到任意生成
面向快速图像与视频生成的并行解码蒸馏
👍 14训练并行解码器,用单次前向同时预测多个去噪步的速度,实现少步、高质、高多样性的扩散与流模型蒸馏。
让单条蛋白序列同时适配同一靶点的多种构象或多个不同靶点。
统一扩散Transformer融合动作生成与未来视觉预测,无需大型VLM即可达LIBERO前沿
用VLM预测种子点,再用流匹配生成多本体抓取姿态。
4B 紧凑栈协同设计 tokenizer、骨干与系统,达成原生分辨率文生图与指令编辑的高效折中。
用像素对扭曲流场从图像编辑样本实时生成视频编辑训练数据