热心市民王先生

TurboVLA

#论文解读 #Hugging Face #机器人学习 #具身智能

基于 Hugging Face Daily Papers 2026-07-30 榜首论文,深入解读 TurboVLA 如何绕开大语言模型中心路径,以双向视觉语言交互和并行动作块实现 32 Hz、0.9 GB 显存的机器人控制,并审视其实验边界与部署价值。

自动研究时间:2026-07-31 09:02(Asia/Shanghai)
来源日期:Hugging Face Daily Papers 页面实际显示 Jul 30,列表最顶部为 TurboVLA;详情页标注 #1 Paper of the day
研究路径:Daily Papers 列表 -> Hugging Face 详情页 -> arXiv 摘要页 -> 16 页 arXiv PDF 与完整 HTML 论文 -> 项目页和官方代码仓库交叉核对。

执行摘要

主流 Vision-Language-Action(VLA)模型常把大语言模型放在视觉与动作之间:图像先被投影到语言模型的表示空间,语言模型融合视觉和指令,再由自回归解码器或动作专家生成控制信号。这条 (V \rightarrow L \rightarrow A) 路径能继承大规模预训练的语义与推理能力,但也意味着机器人每次更新动作,都要让数十亿参数的语言主干重新参与计算。

TurboVLA 提出一个针对“执行层”的激进简化:如果指令已经清楚地说明要完成什么,低层控制未必需要在每个时间步重新调用通用语言推理。模型因此改成直接的 (V + L \rightarrow A) 路径:DINOv3 编码一个或多个相机视角,BERT 编码完整的指令 token 序列,六层双向 cross-attention 让视觉和语言互相条件化,最后由 ACT 风格的小型 Transformer 解码器一次并行生成连续动作块。机器人状态不参与前面的视觉语言对齐,而是在动作解码阶段注入。

在 LIBERO 四个套件共 2,000 次 rollout 中,ViT-B 版本以约 0.2B 参数取得 97.7% 平均成功率;完整在线策略在单张 RTX 4090、batch size 1 下峰值显存 0.9 GB,从多模态输入到动作块的延迟为 31.2 ms。相较 (\pi_{0.5}),其成功率为 97.7% 对 96.9%,参数约为后者的 6%,延迟为 31.2 ms 对 93.6 ms。RoboTwin 2.0 的 50 项 clean 双臂任务中,ViT-L 版本以 0.4B 参数和 43.4 ms 延迟取得 60.2%,也高于 (\pi_{0.5}) 的 57.0%。

真实机器人实验进一步在 AgileX Piper 上测试四项任务,每项 40 次:TurboVLA 分别达到 92.5%、80.0%、90.0% 和 87.5%,论文称四项均高于同协议的 (\pi_{0.5})。这说明直接视觉语言融合足以支撑一组具体执行指令,但还不能证明它可以替代 LLM 承担开放词汇泛化、复杂任务分解和高层规划。

因此,TurboVLA 的主要意义不是“机器人不再需要语言模型”,而是提出一种更清晰的分层方向:让 LLM 负责低频、复杂的计划,让轻量 VLA 负责高频、闭环的执行。论文对性能—参数—延迟—显存的联合优化很有说服力;不过,真实实验只有单一平台和四项任务,RoboTwin 只评估 clean setting,效率数字也集中在 RTX 4090,边缘设备、扰动场景和长时任务上的普适性仍待验证。

1. 论文基本信息

项目内容
论文标题TurboVLA: Real-Time Vision-Language-Action Model at 32 Hz on an RTX 4090 with <1 GB VRAM
论文编号arXiv:2607.27205
arXiv 版本v1,2026-07-29 提交
Hugging Face 状态2026-07-30 Daily Papers 榜首,#1 Paper of the day
作者Hengyi Xie、Chenfei Yao、Xianjin Wu、Xuanyang Xi、Yiping Tang、Di Xu、Yingying Zhu、Dingkang Liang、Xiang Bai、Han Ding
研究机构华中科技大学、华为技术有限公司
学科分类Computer Vision and Pattern Recognition(cs.CV)、Robotics(cs.RO)
论文规模16 页,包含方法、三类实验环境、消融与完整参考文献
研究对象实时语言条件机器人操作、轻量 VLA、连续动作块预测
开放资源训练与评测代码已发布,代码仓库采用 Apache-2.0 许可

核心链接:

2. 背景与动机:为什么执行层不一定需要大语言模型

2.1 LLM 中心路径的能力与代价

现有 VLA 大致可分成两类:

路线代表模型动作生成方式仍然存在的主要成本
动作 token 自回归RT-2、OpenVLA把动作离散化,像文本一样逐 token 生成既要通过大语言模型,又有顺序解码延迟
连续动作专家(\pi_0)、(\pi_{0.5})、CogACT大语言模型先产生多模态表示,独立专家并行解码连续动作省去动作 token 串行生成,但大语言主干仍参与每次策略调用

LLM 中心设计的优势很明确:它能把 Web 规模预训练获得的开放词汇语义、常识和任务推理迁移到机器人。然而,在“把碗放到盘子上”这类指令已经确定的执行阶段,策略主要需要回答的是:当前画面中的哪个目标与指令相关,机器人下一段轨迹应该如何变化。通用文本生成和开放式任务分解能力在每次低层控制更新中都未必必要。

由此产生的核心问题不是“语言有没有用”,而是:

语言条件是否必须经由数十亿参数的生成式语言模型,才能转化为高质量的连续控制?

TurboVLA 的答案是否定的。它保留语义指令,移除的是 LLM 作为视觉到动作的中心接口。

2.2 实时性为什么是架构问题

提升 VLA 速度通常有三条路线:

  1. 在动作侧并行解码、使用 action chunk 或连续 action expert;
  2. 对大主干做量化、剪枝、token 缓存、动态深度或蒸馏;
  3. 在系统侧使用异步执行、流式推理或推测推理。

这些方法大多保留了大多模态主干。TurboVLA 更进一步,直接缩短信息路径,从结构上减少中间激活、注意力计算和常驻参数。它优化的不是单个内核,而是让执行表征不再必须经过 LLM。

需要准确理解论文标题中的“32 Hz”:31.2 ms 是从接收当前多模态观测到生成一个动作块的策略延迟,约等于每秒 32 次策略前向调用。它不是对所有机器人底层伺服环频率的统一声明,也不包含任意平台上的传感、通信和执行全链路开销。

3. 核心贡献

3.1 从 (V \rightarrow L \rightarrow A) 改为 (V + L \rightarrow A)

论文把视觉、语言和本体状态分别编码,再为执行任务构造专用表示。这样既没有删除语言,也没有退回只靠视觉的行为克隆;改变的是模态交互发生的位置和规模。

3.2 轻量但显式的双向视觉语言交互

视觉查询语言让每个视觉位置知道指令关注什么,语言查询视觉让指令 token 获得当前场景上下文。双向更新后再将两条特征流送入动作解码器,避免简单拼接留下的对齐负担。

消融显示,这个设计不是可有可无:无 cross-attention 的直接拼接平均成功率为 95.2%,单向交互分别为 96.1% 和 96.5%,双向交互达到 97.7%。

3.3 一次前向并行预测连续动作块

模型不把动作离散成 token,也不逐步自回归生成。(H) 个可学习 action query 同时预测 (H) 步连续动作,训练只使用专家轨迹上的行为克隆与 (L_1) 损失,不需要辅助语言建模目标。

3.4 同时报告性能和完整在线策略成本

作者没有只给参数量或模型核心延迟,而是在 RTX 4090、batch size 1 下报告:

  • 完整在线策略总参数;
  • 从多模态输入到动作块的延迟;
  • 完整策略的峰值推理显存;
  • 对应任务成功率。

这使读者可以直接观察成功率、模型规模、响应速度和显存之间的联合前沿,而不是用单一效率指标替代部署判断。

4. 方法详解

4.1 多模态特征编码

给定指令 (x),轻量文本编码器保留每个 token 的输出,而不是只使用一个 pooled embedding:

[ Z^l = P_l(f_{\text{text}}(x)) \in \mathbb{R}^{N_l \times d} ]

保留完整序列是为了让物体名、属性和空间关系继续参与细粒度视觉条件化。默认文本编码器是 BERT,但消融也测试了 T5-Small 和 SigLIP-Base。

对第 (i) 个相机画面,DINOv3 提取空间特征,再加入位置编码和视角编码:

[ Z_n^{v,(i)}

P_v(f_{\text{img}}(I_n^{(i)}))

  • E_{\text{pos}}^{(i)}
  • e_{\text{view}}^{(i)} ]

多个视角的 token 被直接串联。位置编码保存单视角内部的空间结构,视角编码标记 token 来自哪一台相机。

机器人本体状态 (s_n) 由小型投影网络编码为 (Z_n^s),但不进入视觉语言交互模块。作者的理由是:本体状态对把场景理解转换成可执行动作很重要,却不是视觉对象与语言概念建立对应关系的必要输入。

4.2 六层双向 cross-attention

默认隐藏维度为 (d=256),视觉与语言特征经过 (N=6) 个交互层:

[ (V_n^\ell, L_n^\ell)

\operatorname{FusionLayer}_\ell(V_n^{\ell-1}, L_n^{\ell-1}) ]

每层包含 LayerNorm、两个方向的 cross-attention、各模态独立的前馈网络和残差连接:

  • 视觉到语言:用视觉上下文更新指令,使“杯子”“左边”等 token 对当前场景具体化;
  • 语言到视觉:用指令更新视觉 token,突出与任务相关的物体、属性和区域。

最终的视觉与语言序列拼接成 (Z_n^{vl})。这些交互层由 Grounding DINO 的 grounding-pretrained feature-enhancement 权重初始化,把已经学到的细粒度视觉文本对齐迁移到控制任务。

4.3 ACT 风格动作块解码

动作解码器接收融合特征、本体状态和 (H) 个可学习查询:

[ \hat{\mathbf A}_n

D_\theta \left( Q_a,,[Z_n^{vl};Z_n^s] \right) \in \mathbb{R}^{H \times d_a} ]

所有动作查询同时解码,因此一个前向过程即可得到完整动作块。LIBERO 使用 (H=12) 的 7-DoF 连续动作;RoboTwin 使用 (H=50) 的 14 维双臂绝对关节位置。

模型通过专家动作块做行为克隆,目标为 (L_1) 损失。这个训练目标简单,也意味着策略能力主要受示范分布限制:它没有在线强化学习、失败恢复目标或显式安全约束。

4.4 默认训练配置

组件默认设置
视觉骨干LIBERO:DINOv3 ViT-B;RoboTwin:DINOv3 ViT-L
文本编码器BERT
共享隐藏维度256
双向交互层数6
动作解码器ACT 风格 Transformer decoder
训练目标行为克隆,(L_1) loss
学习率(5 \times 10^{-5})
训练硬件4 张 RTX 4090

5. 实验设计

5.1 LIBERO:单臂、四套件联合训练

LIBERO 包含 Spatial、Object、Goal 和 Long 四个套件,每套十项语言条件任务。作者使用 OpenVLA 发布的 no_noops RLDS 数据,将四个套件混合训练为一个策略:

  • DINOv3 ViT-B;
  • 12 步、7-DoF 连续动作块;
  • 80,000 个训练 step,10,000 个 warm-up step;
  • 有效 batch size 256;
  • 每项任务 50 次 rollout,共 2,000 次。

5.2 RoboTwin 2.0:双臂、50 项 clean 任务

RoboTwin 2.0 用于检验双臂多任务扩展:

  • 只使用官方 clean demonstrations,不包含 randomized-scene 数据;
  • 一个模型联合训练全部 50 项任务;
  • DINOv3 ViT-L;
  • 50 步、14 维绝对关节位置动作块;
  • 55,000 个训练 step,1,000 个 warm-up step;
  • 有效 batch size 192;
  • 每项任务 100 次 clean-setting rollout,共 5,000 次。

“只测 clean setting”非常关键。60.2% 说明模型在统一干净分布下能扩展到双臂多任务,并不等于它已验证跨随机背景、物体纹理、光照或相机扰动的鲁棒性。

5.3 真实 AgileX Piper

真实平台测试四项操作:

  1. 抓取滚筒;
  2. 移开扑克牌;
  3. 按压订书机;
  4. 堆叠三个碗。

模型先在 LIBERO 上预训练,再使用每项 65 条遥操作示范微调,共 (4 \times 65) 条,训练 12,500 step。每项任务执行 40 次,与 (\pi_{0.5}) 使用相同平台、训练数据和评测协议。

这个设置验证了小样本真实微调后的闭环执行,但不是零样本 sim-to-real,也不是只用仿真数据直接部署。

6. 主要实验结果

6.1 LIBERO 的性能—效率前沿

方法参数量推理显存延迟LIBERO 平均成功率
(\pi_{0.5})3.4B12.8 GB93.6 ms96.9%
OpenVLA-OFT7.7B15.7 GB112.2 ms97.1%
DDVLA7.5B14.5 GB60.8 ms96.4%
VLA-Adapter1.5B4.3 GB87.3 ms97.3%
Evo-10.8B1.7 GB137.2 ms94.8%
TurboVLA0.2B0.9 GB31.2 ms97.7%

TurboVLA 在四套件上的成功率分别为:

套件成功率
Spatial99.2%
Object99.8%
Goal97.4%
Long94.2%
平均97.7%

最有分量的结果不是比单一模型高出几个小数点,而是以明显更低的参数、显存和延迟维持同一档成功率。相较 (\pi_{0.5}),延迟约降低 66.7%,显存约降低 93.0%。

不过,这张表不能完全视为架构的严格因果实验。各方法的预训练数据、视觉骨干、训练配方和 embodied pretraining 并不统一。TurboVLA 的“无额外机器人预训练”具有吸引力,但不同方法仍存在数据与实现差异。

6.2 RoboTwin 2.0 的双臂扩展

多任务方法参数量延迟50 项 clean 任务平均成功率
UP-VLA1.6B74.3 ms52.9%
(\pi_{0.5})3.4B95.6 ms57.0%
StarVLA-(\alpha)3.8B74.9 ms50.3%
TurboVLA0.4B43.4 ms60.2%

ViT-L 版本的参数增加到 0.4B,但仍显著小于对照 VLA。60.2% 也表明这还不是接近饱和的 benchmark:即便领先对照,约四成 rollout 仍失败。

6.3 真实机器人结果

TurboVLA 在四项真实任务上的成功率为:

任务TurboVLA 成功率成功次数换算
抓取滚筒92.5%37/40
移开扑克牌80.0%32/40
按压订书机90.0%36/40
堆叠三个碗87.5%35/40
汇总87.5%140/160

每项 40 次意味着一次成功对应 2.5 个百分点。论文图中 TurboVLA 四项均优于 (\pi_{0.5}),但任务数、平台数和总试验规模仍有限,适合支持“可部署性初步成立”,不适合推导广泛的现实机器人领先结论。

7. 消融实验:效率来自哪里

7.1 语言不能被删除

条件LIBERO 平均成功率
无语言70.8%
Task-ID embedding95.4%
语义指令97.7%

无语言时,LIBERO-Goal 从 97.4% 降到 11.6%。这说明 TurboVLA 的论点不是“视觉足够”,而是“执行层需要语义语言,但未必需要生成式 LLM”。Task ID 虽能恢复闭集任务身份,却比自然语言低 2.3 个百分点。

7.2 文本编码器不绑定 BERT

文本编码器总参数平均成功率
SigLIP-Base216.9M95.5%
T5-Small141.9M97.1%
BERT216.1M97.7%

T5-Small 更小且只落后 0.6 个百分点,支持“轻量文本表征足够完成具体执行指令”。同时,这也提示默认 BERT 可能不是效率最优点。

7.3 双向交互与深度

交互设计平均成功率
无交互,直接拼接95.2%
语言查询视觉96.1%
视觉查询语言96.5%
双向交互97.7%

交互层从 2 层增至 6 层时,成功率从 93.5% 升至 97.7%;继续加到 8 层反而降到 96.6%。这说明直接融合并非越深越好,六层是当前设置下的容量与效率折中,不是普遍常数。

7.4 动作 horizon

LIBERO 上,(H=8,10,12,15) 的平均成功率分别为 96.4%、96.9%、97.7% 和 95.6%。短 horizon 的时间表达不足,过长 horizon 又增加整段预测难度。默认 (H=12) 是这一任务分布下的最佳点。

8. 局限与批判性分析

8.1 论文较扎实的部分

  • 问题定义清楚:区分高层计划与执行层控制,挑战的是 LLM 在每次策略调用中的必要性;
  • 效率口径相对完整:同时报告完整在线策略的参数、峰值显存、输入到动作块延迟和成功率;
  • 评测覆盖三个层级:单臂仿真、双臂多任务仿真和真实机器人;
  • 关键模块有消融:语言、文本编码器、交互方向、交互深度和动作 horizon 都有对照;
  • 代码可复查:官方仓库发布了 LIBERO 与 RoboTwin 的训练、数据准备和评测流程。

8.2 尚未解决的问题

  1. 高层语义能力被主动舍弃:作者明确承认模型主要面向具体执行指令,不能承担复杂规划、任务分解和开放式推理;
  2. 真实机器人覆盖窄:只有 AgileX Piper、四项桌面任务和 260 条微调示范,没有跨机械臂、移动操作或长时多阶段任务;
  3. 不是零样本现实部署:真实模型从 LIBERO checkpoint 出发,并用真实遥操作数据微调;
  4. RoboTwin 只测 clean setting:没有使用 randomized-scene 数据,无法证明复杂视觉和物理扰动下的鲁棒性;
  5. 硬件结论集中在 RTX 4090:0.9 GB 显存有利于边缘部署,但论文没有报告 Jetson、移动 GPU、CPU、功耗、热约束或量化后的端到端表现;
  6. 延迟不是完整机器人周期:31.2 ms 覆盖多模态输入到动作块输出,不等于相机曝光、数据传输、控制器通信和执行器响应的总闭环时延;
  7. 跨方法比较仍有混杂变量:各模型的预训练数据、骨干、动作表示和训练配方不同,表格展示的是系统结果而非纯架构消融;
  8. 行为克隆缺少恢复机制:(L_1) 模仿损失没有显式处理分布外状态、安全约束和失败恢复,长时闭环可能积累误差;
  9. 真实对照统计有限:每项 40 次,论文没有给置信区间或跨随机种子统计;
  10. “32 Hz”是动作块生成率:实际机器人能否按该频率稳定重规划,还取决于动作块执行方式、同步机制和平台控制栈。

8.3 对论文结论的准确表述

论文支持:

[ \text{具体语言指令下的执行控制} ;\not\Rightarrow; \text{每次都必须经过生成式 LLM} ]

论文尚未支持:

[ \text{通用机器人智能} ;\not\Rightarrow; \text{需要 LLM 或其他高层推理模块} ]

TurboVLA 移除的是低层执行路径中的 LLM,不是语言条件,也不是高层规划在复杂机器人系统中的价值。

9. 应用影响

9.1 本地、低延迟的机器人策略

不足 1 GB 的推理显存让策略有机会与感知、地图或安全模块共存,而不必占用十余 GB 显存。对网络不稳定或隐私敏感的工厂、实验室、家庭设备,本地执行可减少云端往返延迟和断网风险。

但“RTX 4090 上低显存”不等于“任意边缘芯片上高效”。落地还需测量算力利用率、内存带宽、功耗、量化误差和实际控制链路。

9.2 规划器与执行器分层

更具现实意义的系统形态可能是:

  • LLM/VLM 以较低频率理解开放式目标、拆分任务、选择技能;
  • TurboVLA 类执行策略以较高频率接收明确指令和实时视觉,输出连续动作块;
  • 安全控制器独立监控碰撞、关节限制和异常状态。

这种分层把昂贵推理留给真正需要语义推理的节点,又避免在每个控制周期重复付费。

9.3 更合理的 VLA 评测维度

论文推动社区从只比成功率,转向至少四维联合评估:

维度需要回答的问题
任务能力完成率、泛化和长时稳定性如何
响应速度策略延迟、动作更新率和尾延迟如何
常驻资源参数、显存、内存和功耗如何
系统边界哪些能力交给高层规划,哪些留在低层执行

高成功率但只能远程调用的大模型,与略低成功率但可在机器人本地实时运行的模型,服务的是不同部署约束。

9.4 落地前的验证清单

决策问题建议验证
是否能在目标硬件实时运行在实际边缘芯片上测 p50/p95 延迟、功耗、温升和峰值内存
是否真的提高闭环响应将相机、预处理、策略、通信和执行器纳入端到端延迟
是否能应对环境变化测试光照、背景、遮挡、相机偏移、物体材质和动力学扰动
是否能执行长任务引入失败恢复、动作重规划和多阶段任务,统计随时间增长的成功率
是否需要高层模型区分固定具体指令与需要解释、分解或澄清的开放式目标
是否满足安全要求增加独立安全层、异常检测、人工接管和分布外状态审计

10. 相关工作与论文定位

  • RT-1 证明 Transformer 可在大规模真实机器人数据上学习多任务控制;
  • RT-2 与 OpenVLA 把视觉语言知识通过动作 token 接口迁移到机器人,代表自回归 LLM/VLM 中心路线;
  • (\pi_0) 与 (\pi_{0.5}) 使用连续动作专家避免逐 token 动作生成,但仍以大型预训练多模态主干构造执行表示;
  • TinyVLA、RoboMamba、SmolVLA、VLA-Adapter 与 Evo-1 从小模型、状态空间结构或适配器角度降低规模和推理成本;
  • OpenVLA-OFT、DDVLA 重点改进动作生成速度,但仍保留大语言骨干;
  • 量化、token 缓存、剪枝、动态深度与蒸馏 在不彻底改变信息路径的前提下压缩现有 VLA;
  • CLIPort、BC-Z、CALVIN、HULC、PerAct 与 VIMA 更早展示了自然语言可以直接作为控制条件,而不必总是承担文本生成角色;
  • Grounding DINO 为 TurboVLA 提供双向视觉语言特征交互和初始化思路;
  • ACT 提供并行连续动作块解码器,使完整 horizon 可在单次前向中生成。

TurboVLA 的新位置,是把早期“语言条件控制”与当前强视觉骨干、grounding 预训练和 action chunking 重新组合,并在主流 VLA 评测上展示一个更好的性能—部署成本前沿。它不是否定大模型,而是重新划分大模型应该出现在哪一层。

11. 结论

TurboVLA 提出了一项简单但重要的架构判断:对于已经明确的执行指令,VLA 不必把大语言模型当作视觉到动作之间的唯一桥梁。DINOv3、BERT、六层双向视觉语言交互和 ACT 风格动作块解码器,组成了一个约 0.2B 参数、0.9 GB 推理显存、31.2 ms 策略延迟的直接 (V + L \rightarrow A) 路径。

LIBERO 的 97.7%、RoboTwin clean50 的 60.2% 和四项真实任务共 140/160 次成功,说明这种简化没有把执行性能一起删掉。消融又表明,真正有效的不是去掉语言,而是用轻量语义编码和显式双向对齐替代每次都经过生成式 LLM。

它的边界同样清楚:真实验证仍小,复杂规划能力不在模型内,边缘硬件与扰动鲁棒性没有充分评估。最值得延伸的方向不是把所有 VLA 都缩成同一种网络,而是构建分层机器人系统,让高层模型处理低频推理,让 TurboVLA 类模型承担高频执行,并用独立安全层约束闭环行为。

如果后续研究能在多机器人、多场景扰动、长时任务和真实边缘芯片上维持这一效率前沿,TurboVLA 可能推动 VLA 从“把大模型接到机器人上”,转向“按控制层级分配模型能力与计算预算”。

参考资料

  1. Hugging Face Daily Papers:TurboVLA
  2. TurboVLA arXiv 摘要页
  3. TurboVLA 完整论文 PDF
  4. TurboVLA arXiv HTML 全文
  5. TurboVLA 项目主页
  6. TurboVLA 官方代码仓库
  7. LIBERO Benchmark
  8. RoboTwin 2.0
  9. OpenVLA
  10. (\pi_0)
  11. SmolVLA
  12. ACT
  13. Grounding DINO