GOAG:面向灵巧机器人操作的生成式、物体无关抓取规划器 GOAG: Generative and Object-Agnostic Grasp Planner for Dexterous Robotic Manipulation
只用夹爪几何训练CVAE学习接触分布,推理时才见物体,零样本生成灵巧抓取
前置知识
CVAE(条件变分自编码器)
一种生成模型:编码器把输入 $x$ 与条件 $c$ 映射为后验分布 $q_\theta(z \mid x, c)$ 并采样潜变量 $z$,解码器由 $[z, c]$ 重构输出;训练最小化重构误差加 KL 散度正则,使 $z$ 的聚合后验逼近标准正态 $\mathcal{N}(0, I)$。推理时可直接从先验采样 $z$ 配合条件生成新样本,天然支持多样性。
GOAG 的核心就是一个以点云距离场为条件的 CVAE,用于生成夹爪接触分布;理解其编码-解码结构与 KL 项,才能看懂训练损失和推理时从 $\mathcal{N}(0, I)$ 采样的设计。
BPS(Basis Point Set,基点集编码)
把任意大小的点云转成固定长度向量的编码方法:在固定空间中布设 $M$ 个基点 $W \in \mathbb{R}^{M \times 3}$,对每个基点计算它到输入点云的对齐距离,得到 $M$ 维距离场 $F_P$。不同规模的点云由此获得统一表示,可直接送入全连接网络处理。
GOAG 把基点集绑定在夹爪工作空间上,训练时编码夹爪 $H(Q)$、推理时编码物体 $O$,是两个阶段共享同一网络的关键,也带来了刻意的跨域迁移挑战。
力闭合(Force Closure)
抓取稳定性判据:在各接触点按库仑摩擦模型(摩擦系数 $\mu$)施加单位力,把所有可能的力旋量汇成抓取力旋量空间;若其凸包严格包含原点,则手指能抵消任意方向的外力与力矩,抓取在理论上稳定。
GOAG 生成的接触点来自生成采样,并不天然保证稳定,因此流水线在关节优化前专门对接触质心做力闭合检验,不通过就重采样潜变量。
灵巧手与多指抓取
多指灵巧手(如 Barrett、Allegro、ShadowHand)拥有十几到二十多个关节自由度,一次抓取由物体相对位姿 $[R, T]$ 与关节值 $Q$ 共同描述。相比二指平行夹爪,其构型空间巨大,GraspIt! 等解析规划太慢,深度学习成为主流,但学起来也更难。
论文要解决的就是灵巧手抓取的泛化难题;在 Barrett/Allegro/ShadowHand 三种手上的实验是验证方法对不同运动学适应性的核心证据。
点云与 PointNet++
点云是物体表面的三维采样点集合(通常含法向量)。PointNet++ 通过分层最远点采样和局部邻域特征聚合,直接在无序点集上学习表示,并支持逐点分类,例如把每个接触点分配给对应的手指指节。
GOAG 用 PointNet++ 训练 Links Mapper,把生成的接触点映射到具体夹爪连杆,这个“接触点属于哪根手指”的分配是后续关节优化的必要输入。
Isaac Gym 与抓取成功率协议
NVIDIA 的 GPU 并行物理仿真器,可在数千个环境中同时仿真刚体接触。抓取评估的通行做法是:把物体和夹爪初始化在优化构型 $Q^*$,沿 $\pm x, \pm y, \pm z$ 方向依次对物体施加外力各 1 秒,若物体偏离原位小于 2 厘米则判为抓取成功。
论文所有成功率均由 Isaac Gym 验证,理解该协议(外力扰动 + 2cm 阈值)才能正确解读 Table II 和 Table III 中的数字及其可比性。
研究动机
灵巧多指抓取长期是机器人操作的难题。解析方法如 GraspIt! 精度可控但计算昂贵,难以满足实时要求;现代数据驱动方法推理快,却完全依赖大规模抓取数据库——这些数据库把特定夹爪与特定物体一一绑定,需要人工演示、动作捕捉、遥操作或 Isaac Gym 仿真逐对生成并验证,代价高昂(GenDexGrasp 为生成数据耗费约 1400 个 A100 GPU 小时)。更致命的是泛化:在这种物体特定数据上训练的模型会内化训练物体的几何偏置,一旦面对训练分布之外的新物体形状(真实世界随处可见),成功率显著下滑。无论直接回归抓取位姿、用扩散模型生成、还是预测接触图等中间表示,现有方法的训练阶段都必须见到“物体-抓取”配对数据,物体偏置无法从根源上消除。
本文的目标是本文要构建第一个训练阶段完全物体无关的数据驱动灵巧抓取规划器 GOAG:训练中不使用任何物体几何或物体-抓取数据库,只从夹爪自身的内在几何与运动学学习“可行接触分布”的紧凑潜表示,推理时才引入目标物体特征,实现对新物体的零样本抓取生成。量化目标包括:在 MultiDex 测试集(Barrett/Allegro/ShadowHand 三种灵巧手、10 个物体)上超越专门在该数据集上训练或微调的 DFC(平均 79.32%)、DRO-Grasp(72.47%)与 GenDexGrasp(70.96%);批量生成抓取时显著快于 GenDexGrasp 的 9.78–16.45 秒/抓取;并在真实 Allegro 手加 7 自由度机械臂平台上成功抓取 YCB 物体,验证 sim-to-real 迁移。
与已有工作不同的是,作者的独特切入点是把视角从“以物体为中心”反转为“以夹爪为中心”。核心观察是:成功抓取会在物体表面和夹爪表面同时诱导出一对几何上几乎重合的接触区域 $\mathcal{C}_O \approx \mathcal{C}_H$(Fig. 1),因此接触区域不必定义在物体上,而可以定义为夹爪的内在属性——把物体用逆变换 $[R, T]^{-1}$ 拉到夹爪坐标系后,接触点就是夹爪表面上与物体距离小于 $\epsilon$ 的点集。既然所有运动学可行的接触模式集合完全由夹爪自身几何与约束决定,就可以在见到任何物体之前,先在夹爪上预计算并学习一张“可行接触流形”,推理时再查询物体形状与之兼容的接触区。这一视角反转让训练彻底脱离物体数据,从源头消除物体偏置。
核心方法
直觉上,GOAG 把“学会抓物体”改写成“学会这只手能怎么接触”。训练阶段:在夹爪关节极限内均匀采样 10,000 个有效构型 $Q$ 并计算表面点云 $H(Q)$;对每个构型按人类抓取分类学(选取覆盖机械师 92.5% 工时的 6 种抓取类型)在掌面和手指内侧定义合法接触区,并随机采样 50 组接触点,得到 300 万张标注点云;用绑定夹爪工作空间的 BPS 编码后,并行训练一个 CVAE 学习接触分布、一个 PointNet++ 学习“接触点→指节”的映射。推理阶段:把物体点云变换到夹爪坐标系并用同一 BPS 编码,从先验 $z \sim \mathcal{N}(0, I)$ 采样,解码出物体上的连续接触场,取置信度 $\hat{c}_i > 0.8$ 的基点为接触点,Links Mapper 指定每点对应的手指;再经力闭合检验与向量化关节优化,输出最终构型 $Q^*$。
核心创新是把接触的定义从物体参考系搬到夹爪参考系:原范式 $\mathcal{C}(O) = \{o_i \in O \mid \exists h_j, D_{\text{aligned}}(o_i, h_j) < \epsilon\}$ 必须见到物体;GOAG 对物体施加 $[R, T]^{-1}$ 后改写为 $\mathcal{C}(H(Q)) = \{h_i \in H(Q) \mid \exists o_j, D_{\text{aligned}}(h_i, o_j) < \epsilon\}$,让接触成为夹爪在构型 $Q$ 下的内在性质。配合抓取分类学先验——每种抓取类型在夹爪表面定义合法接触区,保证采样出的接触点运动学协调、像真实协同抓取而非任意表面接触——模型仅凭夹爪几何就能学出结构化、多样且可行的接触先验。这与 Table I 中所有依赖 Objects+Grippers 训练集的方法形成本质区别:GOAG 的训练集只有 Gripper,抓取位姿靠采样、关节靠优化。
方法步骤详情
流水线分五步。第一步数据生成:均匀采样 10,000 个关节可行构型 $Q$,按法向与掌向夹角阈值提取活动接触面 $H(Q)$,依据 6 类抓取分类学在合法接触区内各采 50 组接触点,得到 300 万标注样本,仅耗约 1 个 RTX 4090 GPU 小时。第二步编码:把工作空间离散为 $M = 8192$ 个基点,计算对齐距离场 $D_{\text{aligned}}(x, y) = e^{\gamma(1 - \langle x - y, n_x \rangle)} \|x - y\|_2$($\gamma = 2.0$),并按 $c_i = 1 - 2(\text{Sigmoid}(D) - 0.5)$ 生成监督信号。第三步训练:CVAE 潜维 $\psi = 128$、$\beta = 0.01$、注意力权重 $\alpha = 3.0$,训练 100 轮;PointNet++ Links Mapper 训练 50 轮。第四步推理:物体经 $[R, T]^{-1}$ 与 BPS 编码后采样 $z$ 解码接触场,以阈值 $\tau = 0.8$ 截取接触点并分配指节。第五步生成:对接触质心做力闭合检验($\mu = 0.3$,失败重采样至多 20 次),再最小化 $E = \lambda_d E_{\text{dist}} + \lambda_p E_{\text{pen}} + \lambda_s E_{\text{spen}} + \lambda_j E_j$ 求最终构型 $Q^*$。
技术新颖性
技术新颖性体现在四点。其一,训练协议的范式突破:这是首个训练期物体无关的灵巧抓取规划器,不需要任何预计算抓取库,数据生成成本从 GenDexGrasp 的 1400 个 A100 GPU 小时降到 1 个 RTX 4090 小时,相差约三个数量级。其二,生成式中间表示:CVAE 在潜空间采样天然提供多样性(一次可批量生成 100 个抓取),而中间接触表示让物理合理性由优化阶段兜底,兼顾了直接生成方法的表达力与接触图方法的物理有效性。其三,工作空间绑定的 BPS 编码人为制造了训练(夹爪 $H(Q)$)与测试(物体 $O$)间的跨域迁移,迫使模型学习“接触语义”而非记忆具体物体。其四,向量化优化:所有候选抓取共享同一个能量函数同时最小化,批量生成 100 个抓取时单个仅耗 0.18–0.20 秒。
实验结果
Table II:在 MultiDex 测试集(ContactDB+YCB 的 10 个物体、每方法 100 次推理)上,GOAG 三手成功率 Barrett 87.40%、Allegro 93.20%、ShadowHand 77.90%,平均 86.93%,高于 DFC 的 79.32%、DRO-Grasp 预训练版的 72.47% 与 GenDexGrasp 的 70.96%;单抓耗时仅 0.18/0.19/0.20 秒(DFC 超 1800 秒、GenDexGrasp 9.78–16.45 秒),DRO-Grasp 虽单抓更快(0.42–1.72 秒)但耗时随抓取数线性增长,批量场景下 GOAG 的向量化优化显著占优。消融显示去掉力闭合模块仍有 84.07% 平均成功率,说明生成先验已隐式学到抓取力学;多样性 $T = 0.0479$ m、$R = 1.401$ rad、$Q = 0.3170$ rad 与最优基线相当。Table III:在 5 个数据集共 3438 个物体上,GOAG 仅用 ShadowHand 训练一次即获平均 53.97%,仅次于逐数据集重训的 DGA(58.48%),其中 MultiDex 77.90%、DexGRAB 62.13%;真实世界用 Allegro 手在 7 自由度机械臂上成功抓取 11 个 YCB 物体。
局限与改进
作者承认的局限:其一,抓取位姿采样采用物体凸包外扩 110% 后沿法向布爪的简单策略,对能被夹爪工作空间包住的物体很有效,但大物体上效果变差,Table III 中 RealDex 仅 37.37%、DexGraspNet 仅 43.07% 可能与此相关;其二,力闭合检验用接触质心简化模型且在夹爪系中不考虑重力与物重,只验证几何可行性,最终质量仍取决于后续优化;其三,重采样上限 20 次,当物体位姿落在工作空间边界、可行接触稀疏时可能直接失败。我的补充观察:MultiDex 测试集只有 10 个物体,统计功效有限;2 厘米位移的成功阈值偏宽松;接触预测依赖物体点云法向质量,真实深度扫描噪声下对齐距离场的鲁棒性未单独消融;6 类抓取分类学可能限制非常规抓取(如工具使用类精细操作);每个新手仍需重训一套模型,跨具身成本未解决。
独立分析的弱点
独立分析三点弱点。第一,位姿提出策略原始:均匀凸包采样对大而薄的物体、需绕到侧面抓取或杯子内部抓取等场景会失效,且作者自己承认这是大物体短板的根源;改进方向是引入基于几何分析(主轴、凹性、 affordance)或学习式的位姿提议网络,让模型直接在物体坐标系预测候选 $[R, T]$。第二,力闭合检验与关节优化割裂:质心力闭合只是粗代理,可能放行理论上稳定但运动学不可达的构型(论文也承认关节优化才是首个接触完整物体几何与夹爪运动学的环节);可借鉴 DFC 的可微力闭合估计器,把稳定性项直接嵌入能量函数端到端求解。第三,BPS 绑定单一夹爪工作空间,物体尺度泛化受限,且每换一只手都要重训模型和数据集;可探索尺度归一化的规范工作空间(作者的后续工作 CoToGrasp 正是此方向),或结合 DRO-Grasp 式跨具身表征,实现单模型服务多手。
未来方向
作者明确提出的方向是设计适配大物体的更先进位姿采样策略,以补齐 Table III 中大规模物体数据集上的短板。基于本文成果可自然延伸:把抓取分类学从 6 个离散类型扩展为连续语义条件甚至语言指令,实现“按指令抓取”(已有 Grasp as you say 类工作可借鉴);利用 CVAE 潜空间的语义结构做抓取检索、插值与编辑;把“推理时才见物体”的特性与在线感知结合,做开放词汇物体的即见即抓;将力闭合估计替换为可微版本并与关节优化联合训练,形成端到端框架;在 Links Mapper 上引入触觉反馈闭环修正接触分配;以及沿 CoToGrasp(ECCV 2026)的接触拓扑与规范工作空间思路继续深挖,让一套接触先验服务多种夹爪。
复现评估
复现条件较为友好。代码与演示视频公开在项目网站 https://cea-list.github.io/goagweb/。论文给出完整超参数:$M = 8192$、$\gamma = 2.0$、$\tau = 0.8$、潜维 $\psi = 128$、$\beta = 0.01$、$\alpha = 3.0$、批大小 128、CVAE 100 轮、PointNet++ 50 轮、能量权重 1.0/50.0/0.1/1.0、自碰撞安全阈值 0.025 米、摩擦系数 $\mu = 0.3$、重采样上限 20 次。算力门槛低:数据生成仅需 1 个 RTX 4090 GPU 小时,训练在多张 A100 上完成但模型紧凑(参数量少于 DRO-Grasp)。主要障碍在于需要 Isaac Gym 评估许可、Barrett/Allegro/ShadowHand 网格模型,以及从文献 [13] 复刻抓取分类学的合法接触区定义;真实机器人复现还需 7 自由度机械臂。总体属中等难度、高度可复现的工作。
论文图表
对比物体视角与夹爪视角:同一对接触区域 $\mathcal{C}_O$ 与 $\mathcal{C}_H$ 从两侧看几何上几乎重合。GOAG 借此仅在夹爪几何上训练即可学到稳健、可泛化的抓取策略,全程无需接触任何抓取数据库或特定物体几何。
一张图讲清全文动机与核心观察:接触区域的视角不变性($\mathcal{C}_O \approx \mathcal{C}_H$)是整个物体无关训练范式得以成立的物理依据。
从抓取表示(直接/中间)、位姿与关节求解方式、力闭合与穿透检查、训练集(是否含物体)、参考系、可选偏好接口等维度,对比 DFC、UniGrasp、GeoMatch、GenDexGrasp、ManiFM、DRO-Grasp、DexDiffuser、DexGrasp Anything 与 GOAG。唯有 GOAG 的训练集是 Gripper Only(仅夹爪),参考系为夹爪且偏好接口支持完整掌部位姿。
一张表定位 GOAG 在灵巧抓取方法谱系中的独特位置:“Training Set = Gripper Only”这一栏就是全文贡献的最简洁概括。
三种灵巧手上的成功率、效率与多样性对比:GOAG 平均成功率 86.93%(Barrett 87.40 / Allegro 93.20 / ShadowHand 77.90),超过 DFC 的 79.32%、DRO-Grasp 的 72.47% 与 GenDexGrasp 的 70.96%;单抓耗时 0.18–0.20 秒,远低于 GenDexGrasp 的 9.78–16.45 秒与 DFC 的超 1800 秒;消融行 GOAG(w/o FC)平均 84.07%,多样性指标与最优方法持平。
本文最核心的定量结果表,同时覆盖主结果、生成效率与力闭合模块消融,是“物体无关也能打赢专用训练”主张的直接证据。
Shadow Hand 在 DexGraspNet、UniDexGrasp、MultiDex、RealDex、DexGRAB 五个测试集(共 3438 个物体)上的成功率:GOAG 为 43.07 / 49.51 / 77.90 / 37.37 / 62.13,平均 53.97% 位列第二;所有对手方法(DGA 58.48、UGG 44.72、SceneDiffuser 37.10 等)均对各自数据集重新训练,而 GOAG 只在 Shadow Hand 运动学上训练过一次。
直接检验零样本跨数据集泛化主张:与逐数据集重训的 SOTA 相比仅落后 4.5 个百分点,凸显物体无关训练的泛化价值;也暴露了大物体数据集(RealDex/DexGraspNet)上的短板。