← 返回 2026-07-30

TurboVLA:基于直接视-语-动作映射的实时视觉-语言-动作模型 TurboVLA: Real-Time Vision-Language-Action Model at 32 Hz on an RTX 4090 with <1 GB VRAM

Hengyi Xie, Chenfei Yao, Xianjin Wu, Xuanyang Xi, Yiping Tang, Di Xu, Yingying Zhu, Dingkang Liang, Xiang Bai, Han Ding 📅 2026-07-29 👍 138 2026-08-04 18:30
实时推理 效率优化 机器人操作 行为克隆 视觉-语言-动作模型 跨模态注意力

摒弃LLM中转,用轻量编码器与双向跨注意力直接预测动作,实现32Hz实时控制

前置知识

视觉-语言-动作模型(VLA)

VLA是一种将视觉观察、自然语言指令和机器人动作整合在统一策略中的框架,使机器人能根据看到的场景和收到的语言指令产生可执行动作。它已成为语言条件机器人操作的主流范式,代表性系统如RT-2、OpenVLA、π0和π0.5。

理解VLA基本范式是读懂本文的前提,因为本文正是对现有VLA架构的根本性反思与重构,需要先清楚主流VLA长什么样才能理解TurboVLA为什么要这样改。

LLM-centric VLA

主流VLA把大语言模型放在视觉到动作路径的中心(V→L→A):视觉特征先投影到语言模型token空间,再与指令拼接由大模型处理,最后解码为动作。这种设计继承了大规模预训练的语义知识,但每个决策步都要经过数十亿参数的大模型,带来巨大计算和内存开销。

这是本文要批判和替代的核心对象,必须理解它的瓶颈才能理解TurboVLA的动机——为何要移除大模型、用轻量跨模态交互取代。

跨注意力(Cross-Attention)

跨注意力是让两个模态特征流交换信息的机制,给定视觉特征$Z_v$和语言特征$Z_l$,可通过$\tilde{Z}_v = Z_v + \mathrm{Attn}(Q_v, K_l, V_l)$让语言条件化视觉,交换查询与上下文模态则得到视觉感知的语言特征。Grounding DINO等视觉定位模型广泛采用这种直接跨模态交互建立文本概念与视觉内容的细粒度对应。

双向跨注意力是TurboVLA的核心模块,理解它能解释为何不需要大语言模型也能在视觉与语言间建立任务相关的对应关系,这正是替换LLM的关键技术支撑。

动作块与ACT解码器

动作块指策略一次性预测的连续动作序列(如$H$步7-DoF动作),由ACT方法提出。通过可学习的动作查询(action queries)$Q_a = [q_1, \ldots, q_H]$并行解码整段动作,避免了自回归逐token生成,显著降低延迟。TurboVLA采用ACT式transformer解码器在单次前向传播中输出完整动作块。

并行动作块解码是TurboVLA高速推理(31.2ms)的关键来源之一,理解它才能理解32Hz控制频率和单次前向传播的设计逻辑。

行为克隆(Behavior Cloning)

行为克隆是一种模仿学习方法,策略通过在专家示教数据上最小化预测动作与专家动作的差距来学习。TurboVLA采用$\ell_1$损失训练,无需任何辅助语言建模目标,直接回归连续动作块,是一种简洁的监督学习范式。

理解训练目标有助于看清TurboVLA的简洁性——它不需要复杂的预训练或多阶段训练,仅靠$\ell_1$行为克隆即可达到97.7%的成功率。

研究动机

现有VLA模型普遍采用LLM-centric设计,把大语言模型作为视觉与动作之间的中心桥梁,遵循V→L→A的计算路径。这种设计虽能借助大规模预训练获得语义泛化,但在实时机器人执行层面造成严重瓶颈。以π0.5为例,其参数量达3.4B、推理VRAM高达12.8GB、端到端延迟93.6ms,控制频率仅约11Hz;OpenVLA更需7.5B参数和202.9ms延迟。即使是引入动作专家(action expert)的方法如OpenVLA-OFT、DDVLA,虽避免逐token生成动作,但视觉与指令仍需流经数十亿参数的语言骨干,延迟分别为112.2ms和60.8ms。更根本的是,当前VLA主流只有两条路线——自回归动作token生成(慢)或在大模型骨干上挂动作专家(仍重),二者都未触及把大模型从执行路径中移除这一根本问题。实时执行对响应式交互、高吞吐操作和资源受限平台部署至关重要,而数十亿参数的大模型骨干严重抬高了硬件门槛,限制了控制频率,使VLA难以落地到消费级GPU的边缘设备。

本文的目标是本文目标是设计一个简单、优雅且高效的VLA范式,使其能够直接把视觉和语言映射到动作(V+L→A)用于执行级操作,而完全不依赖大语言模型作为中心接口。具体而言,作者希望同时实现三件事:第一,大幅压缩模型规模到亚十亿参数量级;第二,把端到端策略延迟压到毫秒级,使控制频率达到30Hz以上的实时档位;第三,把推理VRAM降到1GB以内,使策略能在消费级RTX 4090上运行。在这些效率目标下,还要保持与大规模VLA相当甚至更优的操作成功率,证明执行级控制不必依赖大模型。最终目标是把语言条件机器人操作的硬件门槛降下来,使其能部署到延迟敏感、资源受限的真实机器人系统。

与已有工作不同的是,本文的独特切入点是一个被忽视的关键观察:语言对于指令条件化的操作是必要的,但执行级控制并不必以大语言模型为中心。一旦指令已经指定了要执行的操作技能,执行策略就无需开放式语言生成或自主任务分解,只需用指令决定当前视觉证据应如何引导动作。换言之,现有方法用通用语言模型的广阔推理与生成能力来承载本应由轻量跨模态交互完成的任务,属于能力过剩、代价过高。作者据此提出:用BERT这样的轻量文本编码器提取执行相关语义,配合紧凑的双向跨模态交互(借鉴Grounding DINO),即可让语言和视觉直接构造控制导向的表征,完全绕开大模型。这一视角填补了'既要语言条件、又不要大模型'这一被现有两条路线共同忽视的空白。

核心方法

TurboVLA的整体思路是先把'是否需要大模型'这个问题从架构层面否定掉,转而用'轻量编码+直接交互+并行解码'三件套重建V+L→A路径。直觉上,执行级任务只需理解'对哪个物体、做什么动作',BERT级别的文本编码器就够用;视觉与语言的对齐也不必经过大模型,双向跨注意力即可建立细粒度对应。技术路线上,TurboVLA分别用DINOv3视觉编码器和BERT文本编码器处理观测与指令,把特征投影到共享隐藏维度$d=256$;然后用$N=6$层双向跨注意力构成的视-语交互模块交换两路信息,得到任务条件的视觉特征和场景感知的指令特征;最后用ACT式transformer解码器结合机器人状态,以可学习的动作查询并行预测$H=12$步连续动作块。整个流程不经过任何大语言模型,训练仅用$\ell_1$行为克隆损失、学习率$5\times10^{-5}$、四张RTX 4090,没有辅助语言建模目标。这种设计直接把中间激活内存和下游注意力开销都压到很低。

核心创新在于把VLA的执行通路从'以大语言模型为中心的多模态接口'重构为'直接的视-语双向交互'。与现有方法的本质区别有三点:其一,不再把视觉投影到大模型token空间再与指令拼接进LLM,而是视觉与语言各自独立编码;其二,用借鉴自Grounding DINO的双向跨注意力(视-语交互模块)替代大模型来建立任务相关对应——视觉到指令的注意力注入场景上下文,指令到视觉的注意力用任务语义条件化视觉特征,两路并行更新,互补且高效;其三,动作预测脱离任何语言表征依赖,ACT式解码器直接在融合特征上并行输出连续动作块,无需动作token化或顺序生成。这套设计回答了一个根本问题:执行级控制是否必须保留大模型作为感知-动作的中心桥梁——TurboVLA用0.2B参数和31.2ms延迟给出了否定答案。

方法步骤详情

执行流程分四步。第一步多模态特征编码:对指令$x$用BERT提取token级特征$Z_l = P_l(f_{\text{text}}(x)) \in \mathbb{R}^{N_l \times d}$,保留完整token序列以留住物体、属性、空间关系;对每个相机观测$I^{(i)}_n$用DINOv3提取空间视觉特征并投影,叠加位置编码与相机视角编码$E^{(i)}_{pos}+e^{(i)}_{view}$,拼接$K$路得$Z^n_v$;机器人状态单独编码为$Z^n_s$,不进交互模块而直接送入解码器。第二步视-语交互:初始化$V^0_n=Z^n_v$、$L^0_n=Z_l$,经$N=6$层融合层逐层更新,每层含层归一化、双向跨注意力和带残差的模态专属FFN,最终拼接$Z^n_{vl}=[V^N_n;L^N_n]$。第三步连续动作块预测:ACT式解码器以$H=12$个可学习动作查询$Q_a$在$Z^n_{vl}$和$Z^n_s$上并行解码,单次前向传播输出$\hat{A}_n = D_\theta(Q_a, Z^n_{vl}; Z^n_s) \in \mathbb{R}^{H \times d_a}$。第四步训练:在专家动作块上用$\ell_1$损失做行为克隆,无辅助目标。整个流程仅需31.2ms。

技术新颖性

TurboVLA的新颖性在于首次系统性地把执行级VLA从LLM-centric范式切换到direct V+L→A范式,且做到在性能不降反升的同时大幅压缩规模与延迟。技术上,它把视觉定位领域的直接跨模态交互(Grounding DINO式)迁移到机器人控制任务,用双向跨注意力同时产生'指令条件的视觉特征'与'场景感知的指令特征',消融证明这比单向或无交互都更强。与SmolVLA、Evo-1等轻量化路线相比,那些方法仍保留预训练多模态骨干作为执行表征,只是缩小规模;TurboVLA则彻底移除大生成式语言骨干,从源头改变架构。与π0/π0.5等动作专家路线相比,那些方法虽并行解码动作,但动作解码器仍依赖大模型产出的特征;TurboVLA的动作解码器直接在轻量交互特征上工作。消融还显示该方法不绑定特定文本骨干(BERT、T5-small、SigLIP均有效),证明'轻量文本编码器+直接交互'这一范式本身的有效性,而非依赖某个特定预训练模型。

From LLM-centric VLA to TurboVLA.
Figure 2: From LLM-centric VLA to TurboVLA.
Vision-language interaction variants.
Figure 5: Vision-language interaction variants.

实验结果

在LIBERO上,TurboVLA以0.2B参数、31.2ms延迟、0.9GB VRAM取得97.7%平均成功率,超越3.4B、93.6ms、96.9%的π0.5,也优于2.8B、108.7ms的VLA-JEPA(97.2%);比加速型OpenVLA-OFT(7.7B,112.2ms,97.1%)和DDVLA(7.5B,60.8ms,96.4%)都更快更准;全面优于轻量型Evo-1(0.8B,137.2ms,94.8%)和VLA-Adapter(1.5B,87.3ms,97.3%)。在RoboTwin 2.0双臂50任务上以0.4B、43.4ms取得60.2%,超过π0.5(57.0%,95.6ms)和StarVLA-α(50.3%,74.9ms)。真实世界AgileX Piper四任务上,抓滚筒、移牌、按订书机、摞碗分别达92.5%、80%、90%、87.5%,全面优于π0.5。消融方面:去掉语言使成功率从97.7%暴跌至70.8%(LIBERO-Goal从97.4%跌到11.6%);任务ID嵌入替代语义指令仍低2.3%;交互设计上无交互95.2%、单向96.1%/96.5%、双向97.7%;深度$N$在6最优($N=8$降至96.6%);horizon $H=12$最优;文本骨干可换(T5-small 97.1%、SigLIP 95.5%)。

Comparison on LIBERO.
Table 1: Comparison on LIBERO.
Comparison on RoboTwin 2.0.
Table 2: Comparison on RoboTwin 2.0.
Effect of language conditioning.
Table 3: Effect of language conditioning.
Effect of vision-language interaction.
Table 5: Effect of vision-language interaction.
Real-world evaluation on the AgileX Piper platform.
Figure 4: Real-world evaluation on the AgileX Piper platform.
查看结构化数据
任务指标本文基线提升
LIBERO四套件平均成功率 平均成功率(%) 97.7% π0.5: 96.9% +0.8个百分点,同时参数降至6%、延迟从93.6ms降到31.2ms
LIBERO推理延迟 端到端延迟(ms) 31.2ms DDVLA: 60.8ms; π0.5: 93.6ms 约2倍于最快加速型VLA、3倍于π0.5,对应32Hz控制频率
LIBERO推理VRAM 推理显存(GB) 0.9GB π0.5: 12.8GB; VLA-JEPA: 5.3GB 降至消费级GPU可轻松承载的亚1GB水平
RoboTwin 2.0双臂50任务 平均成功率(%) 60.2%(0.4B, 43.4ms) π0.5: 57.0%(3.4B, 95.6ms); StarVLA-α: 50.3%(3.8B, 74.9ms) +3.2个百分点且延迟减半,证明可扩展到双臂多任务
真实世界AgileX Piper四任务 成功率(%) 抓滚筒92.5%/移牌80%/按订书机90%/摞碗87.5% π0.5在相同平台数据协议下均更低 四任务全面优于π0.5,验证真实噪声下的稳健性

局限与改进

作者明确承认TurboVLA主要面向具体的执行级指令,可能无法提供高层任务规划所需的复杂语义理解与推理能力。本文所有真实世界实验都基于LIBERO预训练checkpoint微调,未在大规模开放任务集上验证泛化。从我个人观察补充几点局限:第一,所有仿真与真实评测的语言指令都较为简短具体('摞三个碗'之类),缺乏对长难指令、多步组合指令的测试,文档中也没有展示对新物体/新场景的零样本泛化;第二,消融仅基于LIBERO,双向交互的最优深度$N=6$和horizon $H=12$是否在其它embodiment上仍最优未验证;第三,虽然对比了多家VLA的延迟和VRAM,但测量均在单卡batch=1的统一设置下,未涉及多机器人并发或长时部署的内存增长;第四,与LLM-centric方法相比,TurboVLA放弃了开放式语义推理,这意味着它不能像π0.5那样处理需要先理解再规划的任务,适用边界需谨慎界定。

独立分析的弱点

第一,泛化能力存疑:TurboVLA用BERT这种轻量编码器,面对训练分布外的新物体、新指令或新视角时,语言条件的语义覆盖可能不如大模型丰富,论文未给出分布外泛化实验。改进方向是引入更大词汇覆盖的文本编码器或对比学习增强语言端。第二,纯执行级定位限制了应用范围:无法处理需要先推理'先做什么再做什么'的长程任务。改进方向正是作者提到的分层系统,用LLM做高层规划、TurboVLA做低层执行。第三,视-语交互模块虽轻但仍是新引入组件,需grounding预训练权重初始化,从零训练的稳定性与数据效率未充分讨论。改进方向是研究自监督的交互预训练。第四,真实世界实验只有四任务、每任务40轮、仅65条示教,规模偏小,统计上(success rate)的置信区间未给出,结论的稳健性有待更大规模验证。第五,双臂结果(60.2%)虽领先但绝对值不高,说明在需要双臂协调的复杂任务上仍有较大提升空间,可考虑引入双手协同的归纳偏置。

未来方向

作者在结论中明确指出未来方向:探索把LLM的高层规划能力与TurboVLA的高效执行通路结合,构建既智能又高效的分层系统,弥补TurboVLA在复杂语义理解和推理上的不足。基于本文成果,可延伸的方向包括:第一,把direct V+L→A范式扩展到导航、移动操作等更多embodiment,验证其通用性;第二,研究视-语交互模块的自监督预训练,摆脱对grounding预训练权重的依赖,提升从零训练的数据效率;第三,结合异步动作块执行(如π0的ACT流策略)进一步压低有效延迟,逼近更高控制频率;第四,把语言接口扩展为多模态提示(图像+文本+演示),借鉴VIMA思路增强任务表达的灵活性;第五,在更大规模、更开放的基准(如Open X-Embodiment全量)上验证泛化边界,明确该方法相对LLM-centric范式的适用域。此外,量化、剪枝等骨干侧优化虽非本文重点,但与TurboVLA的轻量架构正交,可叠加进一步压缩部署成本。

复现评估

复现性整体较好。作者已公开项目页面和代码仓库(https://github.com/H-EmbodVis/TurboVLA)。论文给出较完整实现细节:视觉骨干DINOv3、文本编码BERT、隐藏维度$d=256$、交互层$N=6$、horizon $H=12$、$\ell_1$损失、学习率$5\times10^{-5}$、四张RTX 4090、LIBERO上80k步(10k warm-up)、有效batch 256;RoboTwin上55k步、batch 192、ViT-L骨干、50步14维动作块。评测协议明确:遵循VLA-Adapter的rollout协议、每任务50轮共2000 trial。所有对比方法的延迟和VRAM均在单卡RTX 4090、batch=1下统一测量,口径一致。复现难点在于:一是需四张4090的训练算力,门槛偏高;二是LIBERO/RoboTwin的rollout评测需仿真环境与较多计算;三是真实世界实验依赖特定AgileX Piper硬件与遥操示教数据,难以完全复现。整体而言仿真部分可较高概率复现,真实世界部分需相应硬件。