← 返回 2026-08-21

CoToGrasp:基于规范工作区学习的接触拓扑条件化灵巧抓取合成 CoToGrasp: Contact-Topology-Conditioned Dexterous Grasp Synthesis via Canonical Workspace Learning

Julien Merand, Boris Meden, Liming Chen, Mathieu Grossard 📅 2026-08-20 👍 7 2026-08-26 18:30
具身智能 机器人学习 灵巧抓取 生成模型

以夹爪为中心学习接触流形,按人类抓取拓扑零样本合成灵巧抓取

前置知识

条件变分自编码器(CVAE)

一种生成模型:编码器把输入与条件映射为隐变量后验 $q(z|x,c)$,解码器以条件 $c$ 和采样的 $z$ 重建输出;训练目标是 ELBO,即重建损失加 KL 散度正则(对先验 $N(0,I)$)。它适合建模'同一条件下有多种合理结果'的多模态分布。

CoToGrasp 用 CVAE 在给定接触拓扑条件下生成随机化的接触掩码,推理时从先验采样 $z$ 还可反复重试以通过力闭合验证。

Set Transformer 与 PMA 池化

处理无序集合的注意力架构:SAB(Set Attention Block)建模集合元素间的交互且具有排列不变性;PMA(Pooling by Multi-head Attention)借助可学习的种子向量把任意大小、顺序的集合压缩成固定长度的全局描述子,是点集/集合任务的标准组件。

本文工作区 token 集合的语义随物体变化,需要用 PMA+SAB 把 Transformer 特征与模板嵌入融合压缩为全局隐描述子 $\mathcal{Z}$。

DGCNN 与点云局部特征

Dynamic Graph CNN 在点云上动态构建 k 近邻图,用 EdgeConv 在边上聚合特征,逐点输出局部几何描述子;相比体素化或投影,它直接消费无序点云并保留细粒度表面结构,是点云深度学习的经典骨干。

论文用改进的 DGCNN 分别编码夹爪(训练时)与物体(推理时)的逐点特征,是两种异构几何在特征域对齐的入口。

力闭合(Force Closure)

抓取稳定性的经典判据:若存在一组满足摩擦锥约束的接触力旋线,能抵消作用于物体上的任意扰动力旋线,则称该抓取为力闭合,即物体无法通过任何微小刚体运动逃逸。解析方法通过抓取矩阵与摩擦锥分析判定。

CoToGrasp 推理时的级联验证采用近似力闭合估计过滤不稳定候选,失败则重采样隐变量,是成功率与合规率的关键保障。

人类抓取分类学(Gonzalez/Feix)

生物力学研究把人手抓取按接触面与功能归类:Cutkosky 按物体与任务、Bullock 按运动动力学、Feix 提出 33 类 GRASP 分类;Gonzalez 进一步只依据手的主动接触面定义 22 个解剖接触区与 21 种接触拓扑,与物体形状完全无关。

本文把 Gonzalez 拓扑当作语义条件接口,映射到夹爪 handprint 生成训练掩码,这是'功能性抓取'的形式化定义。

6D 位姿与 SO(3)

刚体空间位姿由旋转 $R\in SO(3)$ 与平移 $t\in\mathbb{R}^3$ 组成;SO(3) 是行列式为 1 的正交矩阵群,保证旋转不改变长度与手性。抓取常表示为 $(R,t,Q)$,$Q$ 为手指关节配置,handprint 为给定 $(R,t,Q)$ 下夹爪主动接触面的空间嵌入。

论文把全局位姿 $(R,t)$ 解耦为外部先验,只在掌心位于原点的规范系内学习,'物体反转负模'技巧必须基于这一表示理解。

研究动机

当前数据驱动的灵巧抓取规划器(GenDexGrasp、DRO-Grasp、GOAG 等)把抓取当成纯粹的几何稳定性优化:只回答物体'能否被抓住',不回答'为了下游功能任务该怎么抓'。它们大多在解析力闭合合成的数据库上训练,存在严重的模式坍缩——压倒性地默认包络式 power grasp,浪费了灵巧手丰富的关节化接触能力。作者用语义熵量化这一偏置:在 MultiDex 子集上,GenDexGrasp 的 $H_{TC}$ 仅 0.5956、DRO-Grasp 0.6504、GOAG 0.6527、DFC 也只有 0.7389,即生成分布高度集中于少数拓扑;想要一个精准捏合 grasp,系统得生成并拒绝大量功能不合格的候选,效率极低。另一条路是基于人类抓取分类学做条件化(Dexonomy、OmniDexVLG 等),但它们在数据集构建时把拓扑类型与具体物体网格深度耦合,需要海量昂贵的逐物体标注;一旦新物体的局部几何无法容纳预计算的刚性关节模板,优化直接失败或坍缩为功能错误的类型。

本文的目标是本文要构建接触拓扑条件化的灵巧抓取合成框架 CoToGrasp:给定一个语义接触拓扑条件(源自 Gonzalez 分类的 21 种拓扑,归入 Precision、Power、Object-Specific 三大功能组)和一个全新未见物体的点云,合成既物理稳定又严格符合指定接触模式的抓取 $(R,t,Q)$。为此要同时满足三个硬约束:训练完全不依赖物体网格或逐物体拓扑标注(object-agnostic);推理对未见几何零样本泛化;并建立一套能同时量化功能多样性(双熵 $H_{SR}$、$H_{TC}$)与语义合规性(TC)的严格评测方法。最后还要在真实机器人(UR10 + Allegro 手)上验证合成接触拓扑的运动学可行性与物理可执行性。

与已有工作不同的是,独特切入点是'接触的对偶性'加'规范特征工作区'。作者观察到抓取接触本质是对称关系:夹爪表面某点接触物体,当且仅当对应物体点接触夹爪。传统方法问'物体上哪里能碰',把搜索定义在无界、高几何熵的物体表面 $\mathcal{O}$ 上;本文反转为'这个物体会激活我手的哪些区域',把解空间限定在有界、有限运动学流形的夹爪 handprint $\mathcal{H}$ 内。再把物体经 $(R,t)^{-1}$ 拉回掌心位于原点的规范坐标系并反转其表面法线,物体局部几何就变成夹爪表面的'负模'。于是网络可以完全脱离物体训练——训练时只看夹爪点云和拓扑模板,推理时才换入物体点云,两者靠固定的工作区基点集合 $\mathcal{W}$ 在特征域对齐。分类学在此只是纯标注接口而非刚性关节模板,从而彻底绕开物体标注数据集这一瓶颈。

核心方法

直觉上,CoToGrasp 是'先教会机械手自己身上的手法图谱':让网络记住每种手法需要激活 handprint 上的哪些区域,遇到新物体时反推哪些区域会被激活,再把手指摆上去。技术路线分两阶段。训练阶段(物体无关):输入仅是夹爪点云和拓扑标签;改进 DGCNN 提取逐点局部特征 $\mathcal{F}_P$,用对齐距离 $D_{\text{aligned}}(x,y)=e^{\gamma(1-\langle n_x,n_y\rangle)}\lVert x-y\rVert_2$ 门控的 kNN 聚合,投影到固定工作区基点 $\mathcal{W}$ 形成 token;拓扑嵌入 $\mathcal{F}_T$ 拼接每个 token 并加正弦位置编码,经 Transformer 得 $\Phi$;与模板嵌入 $\mathcal{F}_\Lambda$ 一起由 Set Transformer(PMA+SAB)压缩为描述子 $\mathcal{Z}$;CVAE 以 AdaLN 解码器输出区域概率 $\hat{\Lambda}_m$,端到端最小化 ELBO。推理阶段:物体点云变换到规范系后走同一网络($z$ 从先验采样),预测掩码经级联验证后用能量优化求 $Q^*$。

核心创新有三层。第一,对偶反转:把接触学习域从无界、高几何熵的物体表面搬到有界固定的夹爪流形,网络学到的是'夹爪自身的内在接触能力'而非对任意目标几何的记忆,这是零样本泛化的根源。第二,特征化规范工作区:训练与推理在几何上异构(夹爪点云 vs 物体点云),直接学习会让接触推理与物体拓扑纠缠;把两者的 DGCNN 局部特征统一投影到夹爪坐标系下的固定基点集,每个占用点成为 token,Transformer 的多头注意力便能学到每种拓扑固有的接触点空间分布与共现模式。第三,手中心分类学(21 拓扑 × 22 解剖区)只作语义掩码接口:与 Dexonomy 把类型硬编码为关节+接触组合并逐物体标注不同,物体完全不进训练集,标签接口可替换为任何基于接触的表示。本质区别在于:现有方法学'物体→抓法'的映射,本文相反——学'手→手法'的内在流形,物体只以负模形式在推理时出现,宏观多模态交给拓扑条件,类内随机性只需单模态高斯先验即可覆盖。

方法步骤详情

第一步,物体无关训练集:在 Shadow Hand 上采样 10,000 组运动学有效的关节配置 $Q$,经正运动学得 handprint $\mathcal{H}(Q)$,与 21 个模板配对得 210,000 个样本,零物体网格、零仿真。第二步,监督信号:模板 $A_m$ 按 22 个接触区给 handprint 点打区域 ID,以阈值 $\epsilon=0.8$、按 $i^*=\arg\min_{i}D_{\text{aligned}}(h_i(Q),w_j)$ 投影到工作区,超阈值标 0,得真值 $\Lambda_m$。第三步,训练:DGCNN 特征经 kNN 聚合成 token,拼接拓扑嵌入与位置编码过 Transformer 得 $\Phi$;PMA+SAB 与模板嵌入融合压缩为 $\mathcal{Z}$;CVAE 后验采 $z\in\mathbb{R}^{64}$,AdaLN 解码器重建 $\hat{\Lambda}_m$,损失为多类交叉熵加 $\beta$ 加权 KL。第四步,推理:物体点云经 $^{-1}$ 入规范系并反转法线成负模;从 $N(0,I)$ 采 $z$ 预测 $\hat{\Lambda}_m$;标签一致性检查容忍对称差至多 1 个区域;力闭合失败则重采样 $z$(上限 20 次);最后解 $Q^*=\arg\min_Q(\lambda_dE_{dist}+\lambda_pE_{pen}+\lambda_sE_{spen}+\lambda_jE_j+\lambda_rE_{rep})$,排斥项 $E_{rep}$ 令未用手指保持 5mm 安全边距。第五步,自动评测:非对称 Tversky 指数反推拓扑类别,低于 0.5 记为 unknown。

技术新颖性

技术新颖性体现在四点。(1) 训练-推理域转移设计:同一网络训练吃夹爪点云、推理吃物体点云,靠'对齐距离门控的 kNN 特征投影'桥接异构域,而非跨域对抗或微调,这一机制让 10,000 个抓取姿态 × 21 模板的纯夹爪数据就足以支撑零样本泛化。(2) 对 CVAE 多模态难题的结构性解法:宏观抓取多样性显式交给 21 类拓扑条件,类内随机性用标准 $N(0,I)$ 先验即可,避免了后验坍缩与模式混淆。(3) 级联验证管线:把生成模型的'幻觉接触'当可检验假设逐级过滤——标签一致性(对称差容忍 1 区)、重采样式力闭合(≤20 次)、带排斥项 $E_{rep}$ 的能量优化——消融证明去掉该管线 TC 从 17.18% 跌到 14.72%。(4) 评测学贡献:首次提出拓扑合规率 TC 与稳定性/语义双熵 $H_{SR}$、$H_{TC}$ 量化功能多样性,并用非对称 Tversky 识别器自动暴露基线'把未验证包络抓取记作成功'的评测漏洞(表 3 的 † 标记)。相比同样 object-agnostic 的 GOAG,本文首次在其上叠加了语义拓扑条件化。

CoToGrasp Method Overview.
Fig. 2: CoToGrasp Method Overview.
Semantic Grasp Taxonomy and Contact Mapping.
Fig. 3: Semantic Grasp Taxonomy and Contact Mapping.

实验结果

实验在 Shadow Hand 上进行,每拓扑上限 20 次尝试。表 1(MultiDex 子集,无分类学基线):DFC SR 72.15%、GenDexGrasp 71.15%、DRO-Grasp 63.30%、GOAG 77.90%,但语义熵 $H_{TC}$ 全落在 0.59–0.74;CoToGrasp SR 仅 36.94%(Top-5 平均 56.18%),$H_{TC}$ 达 0.83,以 0.11 秒/抓取最快(GOAG 0.20 秒、DFC 超 1800 秒)——SR 下降是主动的:系统被迫在物体几何不供益处合成精准捏等拓扑。图 4 直观展示基线向包络 power grasp 的模式坍缩。表 2(DexGraspNet 测试集 vs Dexonomy):分组 SR 为 Power 29.75%、Precision 22.71%、Object-Specific 25.50%,拓扑平均 27.56% 对 23.80%;TC 17.18% 对 14.28%;$H_{SR}$ 0.96 对 0.91,$H_{TC}$ 0.84 对 0.77。消融:去标签一致性 TC 降至 14.45%,去力闭合 16.26%,全去 14.72%,验证管线关键。表 3:精准捏 M2 上 30.3% 对 10.5%(约 2.9 倍);Dexonomy 在 M11 的 60.5% 与 M21 的 37.2% 为 † 虚高(坍缩后未验证包络抓取被记成功),CoToGrasp 保持 TC 完整下 M21 仍达 33.5%。图 5:真机 UR10 + Allegro 右手(四指,禁用 M6)在 YCB 物体上成功形成并静态保持多种拓扑的抓取。

Comparison with taxonomy-unaware baselines. CoToGrasp achieves the highest semantic entropy (H_TC) and generation speed, overcoming the functional mode collapse typical of unconditioned planners.
Table 1: Comparison with taxonomy-unaware baselines. CoToGrasp achieves the highest semantic entropy (H_TC) and generation speed, overcoming the functional mode collapse typical of unconditioned planners.
Per-Topology results: 3 Power grasps (M13, M18, M21), 2 Precision (M2, M6) and 1 Object-Specific (M11).
Table 3: Per-Topology results: 3 Power grasps (M13, M18, M21), 2 Precision (M2, M6) and 1 Object-Specific (M11).
Functional contact topology distribution across taxonomy-unaware planners.
Fig. 4: Functional contact topology distribution across taxonomy-unaware planners.
Real-World kinematic validation.
Fig. 5: Real-World kinematic validation.
查看结构化数据
任务指标本文基线提升
拓扑条件化抓取(无分类学基线,Shadow Hand,MultiDex 子集) 语义熵 H_TC(功能多样性) 0.83 GOAG 0.6527 / DFC 0.7389 / GenDexGrasp 0.5956 较最强基线 DFC +0.09(相对提升约 12%)
拓扑条件化抓取(同上) 成功率 SR (%) 36.94(Top-5 平均 56.18) GOAG 77.90 主动下降 40.96 个百分点:以物理稳定性换取拓扑合规与功能多样性
拓扑条件化抓取(同上) 生成速度(秒/抓取) 0.11 GOAG 0.20 / DRO-Grasp 1.72 / DFC >1800 较最快基线 GOAG 再快约 45%
分类学条件化合成(DexGraspNet 测试集 vs Dexonomy) 拓扑合规率 TC (%) 17.18 Dexonomy 14.28 +2.90 个百分点(相对提升约 20%)
分类学条件化合成(同上) 拓扑平均 SR (%) 27.56(Power 29.75 / Precision 22.71 / Obj-Spe 25.50) Dexonomy 23.80(Power 27.16 / Precision 12.36 / Obj-Spe 19.62) +3.76 个百分点,精准抓取组近乎翻倍
精准捏合拓扑 M2(per-topology) SR (%) 30.3 Dexonomy 10.5 约 2.9 倍

局限与改进

作者承认的局限:绝对成功率与 TC 不高——无分类学设置下 SR 36.94%,条件化下拓扑平均 27.56%、TC 17.18%;作者归因于非对称 Tversky 度量对动态仿真中必要的细微手指调整惩罚过严(瓶颈分析在补充材料 I)。我观察到的局限:(1) 全局位姿 $(R,t)$ 完全交给外部启发式采样,端到端并未解决'从哪个方向接近'的问题,复杂几何下 20 次重采样预算可能耗尽;(2) 能量优化(式 9)依赖手工权重 $\lambda_i$ 与 5mm 排斥边距,未见敏感性分析;(3) 模板映射 $\zeta$ 到具体 handprint 仍需人工设计,'与具体运动学无关'只在拟人手范围内成立;(4) 真机只演示静态保持,缺动态任务成功率与感知噪声鲁棒性数据;(5) 与 Dexonomy 对比依赖自家识别器把对方输出判为无效,虽有 † 标注,评测口径仍有争议;(6) 训练虽不需物体,但 22 个解剖区到 Shadow Hand 的映射本身是人工标注成果,成本未量化。

独立分析的弱点

弱点一:位姿先验的脆弱性。启发式拓扑条件位姿采样叠加 20 次重采样上限,意味着窄缝、大曲率或拓扑与几何冲突的物体可能整组失败,且每拓扑 20 次预算会掩盖单次成功率偏低的事实。改进方向:引入可学习位姿提议网络,或将 $(R,t)$ 纳入生成过程联合建模。弱点二:阈值刚性。接触判定阈值 $\epsilon=0.8$、对齐距离中的缩放因子 $\gamma$、5mm 排斥边距均为全局常数,对不同尺度与柔性接触不自适应,可改为按局部曲率或物体包围盒自适应门控。弱点三:推理链非学习化。验证+能量优化使单次推理含最多 20 次前向与迭代优化,虽然 0.11 秒/抓取很快,但难于大规模并行部署且可能陷入局部极小,可把整条验证管线蒸馏为前馈网络或用扩散模型替代重采样循环。弱点四:TC 度量的非对称惩罚可能系统性低估真实可用抓取,建议补充'容忍 1-2 个接触区漂移'的软合规指标并与人类标注对齐。弱点五:21 类离散拓扑无法表达'捏偏一点''半握'等连续语义,可把拓扑嵌入扩展为连续潜空间并支持插值。弱点六:真机评价维度单一,缺少施力、滑移、动态扰动下的保持率统计。

未来方向

作者层面的方向:代码已在项目网站 https://cea-list.github.io/cotograspweb/ 开源;明确指出规范工作区使全局位姿可作外部先验,从而支持'运动学关键帧'式应用——沿物体轨迹合成连续、拓扑一致的抓取序列,服务手中重定向、精密工具插入与指步态;补充材料 J 还讨论了 Allegro 手执行精细语义抓取的硬件与控制挑战,暗示需要更好的手指力控。可延伸方向:(1) 与 VLM/LLM 任务解析闭环:从'帮我拿杯子的把手'这类指令自动选择拓扑再调用 CoToGrasp,补上 OmniDexVLG 等语言条件方法缺的几何落地能力;(2) 跨具身预训练:把 21 个模板映射到多种 handprint 上联合训练,检验手中心范式的跨本体泛化,甚至推广到平行爪与软手;(3) Object-Specific 组的自动扩展:用聚类从真实工具使用数据中自动发现新拓扑而非人工标注;(4) 感知鲁棒性:在带噪、部分观测点云上微调工作区投影,量化 sim-to-real 中 TC 的衰减;(5) 动态闭环:把静态保持评价扩展到抬升、旋转、使用中的力控制与滑移恢复指标。

复现评估

复现条件总体较好。代码声明在项目网站 https://cea-list.github.io/cotograspweb/ 开源。训练数据完全自生成,无需物体网格与物理仿真:10,000 关节配置 × 21 模板共 210,000 个样本,规模适中,单张消费级 GPU 应可训练(论文未报算力与训练时长)。评测全基于公开资产:MultiDex 子集、DexGraspNet 测试集、YCB 物体,物理仿真协议沿袭 GenDexGrasp/DRO-Grasp/GOAG 的既有实现,避免自造指标。主要复现风险:(1) Gonzalez 21 模板到 Shadow/Allegro handprint 的映射 $\zeta$ 与 22 个解剖区定义在补充材料 A,需手工复刻到目标手型;(2) 关键超参缺敏感性分析:$\epsilon=0.8$、$\gamma$、KL 权重 $\beta$、能量权重 $\lambda_i$、5mm 边距、20 次重采样上限;(3) 补充材料 E 的启发式位姿采样质量直接影响 SR/TC 绝对值;(4) 与 Dexonomy 对比需复现 Feix→M 拓扑映射及 † 判别逻辑。总体难度中等,适合有灵巧手仿真经验的团队;真机部分需 UR10 + Allegro 硬件。