SoftVTBench:面向可变形物体操作的形变感知视觉-触觉数据集与基准 SoftVTBench: A Deformation-Aware Visuo-Tactile Dataset and Benchmark for Deformable-Object Manipulation
4千条视触觉演示加DSR指标,识别任务成功却过度挤压物体的策略
前置知识
有限元方法(FEM)
把连续物体离散成体网格(四面体/六面体单元),用材料的本构方程数值求解每个内部节点在受力后的位移,从而仿真软体形变。本文中每个可变形资产都是 FEM 体网格,仿真器全程跟踪所有内部节点位置,去掉刚体运动后的节点 RMS 位移就是物体的真实形变量。
本文的形变真值和评分判据完全建立在 FEM 状态之上,不理解 FEM 就无法理解 DSR 为什么能独立于策略观测来度量物体被挤压的程度。
视触觉传感器与 marker 运动
GelSight 类传感器用弹性透明层贴合物体,内嵌相机拍摄接触面的光学图像(触觉 RGB),并跟踪表面印刷 marker 点的位移场。marker 运动直接反映接触处的剪切力和滑移,是视觉外参视角看不到的信息。本文用 TacEx/Taxim/FOTS 在仿真中渲染模拟 GelSight Mini 的双指触觉。
论文的核心数据模态就是双指触觉 RGB + marker 场,实验反复论证这些通道携带外视角 RGB 缺失的接触几何与滑移线索。
扩散策略与 VLA 模型
Diffusion Policy 用扩散模型生成动作块;π0.5 是视觉-语言-动作(VLA)基础模型,接受语言指令在多任务上泛化;FastWAM 是世界-动作模型。三者代表'从零训练''基础模型适配''世界模型'三类策略家族,本文对它们做配对比较。
实验部分的所有结论都来自这三个策略家族在统一协议下的对比,了解它们的范式差异才能理解'策略家族决定违规率'这类发现的含义。
分布内/分布外(ID/OOD)评测
ID 指测试条件落在训练数据的变化范围内;OOD 指故意把某个因素推到训练支持之外。本文的 OOD 协议每次只移动一个因子(光照、质量、杨氏模量各 3 档,共 9 个条件),并复用 ID 参照的初始状态与随机种子,因此性能变化可以归因到单一参数。
'触觉的价值在分布偏移下最一致'是论文的核心结论之一,其可信度正来自这种单因子、配对种子的严格 OOD 设计。
任务成功率(TSR)与过程级评测
TSR 只问指令的任务终点是否达成(物体是否放进目标区),是纯运动学判据;过程级评测则关心达成过程的质量(力、形变、安全裕度)。DSR 属于后者:只有完成任务且峰值形变不超容限才算成功,TSR 与 DSR 之差恰好是'物理不安全的成功'占比。
全文的立论就是 TSR 会系统性掩盖过度挤压,理解这两个指标的层级关系是读懂所有实验表格的前提。
研究动机
现有机器人操作基准(LIBERO、RoboCasa、SIMPLER、RoboTwin 等)几乎只以任务是否完成为判据,无法刻画产生结果的物理接触过程。在可变形物体操作中这种缺失尤其致命:一个策略可能因抓得太松让物体滑落而失败,也可能在完成放置的同时把物体压缩到不可接受的程度——这两种失败模式在『任务成功』指标下都无法与轻柔稳定的操作区分开,而这正是食品、软包装、医疗材料等形变敏感场景的真实风险。作者指出的关键瓶颈不是缺少新指标,而是缺少『记录』:没有任何现有数据集在完整任务轨迹上,既把接触观测暴露给策略,又独立记录接触对物体造成的物理后果。SoftVTBench 的实验直接量化了这种缺失的代价:全部 12 个分布内配置都存在『完成任务但超出形变容限』的成功 rollout,占各配置成功数的 0.7%–24%,只看成功率的评测会系统性地高估策略的物理交互质量。
本文的目标是本文的目标是构建首个同时满足四个条件的资源:完整多阶段任务评测、体可变形物体、策略可见的触觉流、评测者专用的物理真值。具体分两部分:其一,SoftVTBench 数据集——4,000 条专家演示,覆盖 40 个 pick-and-place 任务、四个诊断套件(Object-Soft、Spatial-Soft、Object-Rigid、Spatial-Rigid 各 10 任务/1,000 条演示),包含 10 个体可变形资产及其网格、纹理、质量匹配的刚体孪生,场景总资产超过 50 个;每条轨迹以 20 Hz 同步多视角 RGB、双指触觉 RGB 与 marker 运动、本体感知、语言指令、二值与连续两种夹爪动作编码,以及评测者专用的 FEM 形变状态。其二,闭环基准——通过对象特定的先验校准定义形变感知成功率 DSR:只有既完成任务、又把峰值归一化形变保持在容限内的 rollout 才计为成功,并配套 ID/OOD 配对评测协议。
与已有工作不同的是,作者的独特切入是把问题从『评测需求』重新表述为『数据需求』:一次录制必须携带两路不相交的流——策略可见流供学习使用,评测者专用流(FEM 节点位移、物体位姿、接触与掉落事件)供打分,后者绝不能让策略接触,否则触觉观测就成了给自己的形变评分,评测失去独立性。与最近工作的差异也很明确:DefGraspSim、SoGraB 等基于物理仿真测抓取形变但只评孤立抓取;VTDexManip、ManiFeel 给策略触觉但对象是刚体且只看任务成功;精神上最接近的 Tabero 用闭环力反馈评『轻柔操作』,但对象是刚体、测的是接触力而非软体的实际形变。此外,每条演示同时保存二值与连续两种夹爪动作编码,使『传感模态』与『控制粒度』能在不重采数据的情况下做 2×2 交叉消融——这是分离触觉真实贡献的关键控制变量,此前没有基准具备。
核心方法
整体思路一句话:把『任务完成』与『物理交互质量』拆成两条独立数据流和两个独立指标。直觉上,视觉告诉你物体在哪、该去哪;触觉告诉你接触正在如何演化(接触几何、剪切、滑移、局部压缩);而物体的真实形变只能由仿真内部状态给出,任何从策略观测推断的形变都不可靠。技术路线上,SoftVTBench 用 Isaac Sim + Isaac Lab 实现,分三阶段:(1)物体构建与校准——10 个体可变形资产配刚体孪生,设置 FEM 材料,通过脚本化『抓取-提起-保持』扫描确定每个物体的夹爪包络 $\mathcal{G}_o$ 与形变容限 $\tau_o$;(2)任务生成与采集——按物体类型×变化轴的 2×2 套件设计,脚本专家执行抓放,先物理执行一次、再按存储 replay 渲染,保证视觉、触觉、本体感知、动作、FEM 五路流共享同一 20 Hz 时间线且不做任何重采样插值;(3)评测与策展——自动完整性检查、VLM 语义元数据校验、人工逐条审核与标签抽查。形变度量定义为去除刚体运动后的 FEM 节点 RMS 位移除以初始包围盒对角线,前者区分『被搬运』与『被挤压』,后者让不同尺寸物体的形变可比。
核心创新是形变感知成功率 DSR 及其与策略解耦的对象级校准。令 $D_{i,t}$ 为去除刚体运动、按尺寸归一化的 FEM 节点 RMS 位移,定义轨迹峰值 $R^{(i)}_{\max} = \max_t D_{i,t}/\tau_{o_i}$,则 $$\mathrm{DSR} = \frac{1}{N}\sum_{i=1}^{N} T_i \cdot \mathbb{1}[R^{(i)}_{\max} \le 1]$$ 其中 $T_i$ 为运动学任务判定:$R_{\max}>1$ 的 episode 即使放对位置也判失败,且 $\mathrm{TSR}-\mathrm{DSR}$ 即『成功但物理不安全』的精确占比。与已有方法的本质区别有三:一是容限 $\tau_o$ 在任何策略训练之前由脚本化物理探测确定(稳定抓取峰值位移的 90 分位),评分标准与被评策略完全解耦;二是打分读取策略永远看不到的隐藏状态,判据可事后重算、审计甚至更换而无需重采数据;三是专家采集被校准包络 $\mathcal{G}_o$ 约束,实测 2,000 条可变形演示零违例($R_{\max}$ 中位数 0.433、95 分位 0.713),证明容限可达而非形同虚设。
方法步骤详情
第一步,资产与校准:构建 10 个体可变形资产及网格、纹理、质量匹配的刚体孪生,设 FEM 材料后运行脚本校准——闭合度从松到紧扫描,首次能反复无滑提起的闭合度为 $g_o^{\min}$,容限 $\tau_o$ 取稳定抓取峰值位移的 90 分位,容限内最紧闭合度为 $g_o^{\max}$。第二步,任务与采集:四套件按 2×2 设计各含 10 任务、1,000 演示;每条 episode 随机化物体初始位姿、机器人配置与目标位置,并从 $\mathcal{G}_o$ 采样夹爪闭合度;专家执行接近、抓取、提起、搬运、放置,先物理执行再按存储 replay 渲染,保证五路流在同一 20 Hz 时间线。触觉由 TacEx 渲染模拟 GelSight Mini:Taxim 生成光学外观,FOTS 生成 marker 运动。第三步,质量控制:自动检查同步性/完整性/对齐,VLM 校验语义元数据,人工目检与标签抽查,产出 4,000 条发布数据。第四步,评测:ID 每套件 500 个 held-out 初始状态(每任务 50 个);OOD 用 9 个单因子条件(光强 135→180/270/67.5,质量 ×1.25/1.75/2.5,杨氏模量 ×0.8/0.5/2.0),复用 ID 参照的任务、初始状态与 seed,共 900 episode/套件;策略只见可见流,评测器读隐藏流,上限 300 控制步。
技术新颖性
技术新颖性体现在四点。第一,Table 1 的四要素定位:完整任务、3D 可变形物体、策略可见触觉、评测者专用形变评分,此前没有基准同时具备——LIBERO/ManiSkill2 无触觉也无隐藏形变评分;SoftGym/MoDeSuite 把改变形状当任务目标且无触觉;DefGraspSim/SoGraB 测形变但只评孤立抓取;VTDexManip/ManiFeel 有触觉但对象是刚体;Tabero 对刚体测接触力而非软体形变。第二,『刚体孪生』对照设计把可变形性本身的代价从任务结构难度中剥离——实验显示同一套件上刚→软的代价在 −18.4 到 +12.0 点之间摆动,说明软体基准里的『难度』常常不是形变造成的。第三,双夹爪动作编码(二值+连续)存于每条演示,让传感模态与控制粒度 2×2 交叉消融而无需重采数据,实验证明这种混淆真实且量级可观(+11.4 点的『触觉增益』可被更细的执行控制完全复现)。第四,发布评测者专用流并附每资产校准参数与不同校准百分位的再打分程序,使 DSR 判据本身可审计、可重定义,这种评测标准的开放性在操作基准中相当少见。
实验结果
核心发现有四条。发现一:12 个 ID 配置全部 TSR>DSR,最严重的是 Diffusion Policy VT-C 在 Object-Soft 差 9.6 点(40.0% vs 30.4%,恰 48 条成功 rollout 超容限,占其成功的 24%),Spatial-Soft 差 8.0 点(33.0% vs 25.0%);违规率按家族分层:Diffusion Policy 10–24%、π0.5 8–20%、FastWAM 仅 0.7–6.5%,后者在两个空间套件上差距不超过 0.4 点。发现二:物体变化轴上 π0.5 刚→软掉 18.4 点(60.0%→41.6%),Diffusion Policy 与 FastWAM 仅掉 2.6 和 2.0 点;空间轴上符号反转,FastWAM 在软体上反而高 12.0 点。发现三:π0.5 从 VO-B 出发,仅连续控制(VO-C)TSR +11.4 点(30.2%→41.6%),仅加触觉(VT-B)+10.8 点(41.0%),合并(VT-C)41.4% 无叠加,表观触觉收益可被控制粒度解释;而 DSR 上 VO-C 38.4% 反而高出 VT-B 28.0% 达 10.4 点(违规率 7.7% vs 31.7%)。发现四:OOD 汇总后 VT-C 在 6/6 个比较中 TSR 更高、5/6 中 DSR 更高(符号检验 p=0.016 与 p=0.11);π0.5 VT-C 的 OOD TSR 几乎不掉(41.0%,Δ−0.4;28.4%,Δ+0.8),FastWAM VT-C Object-Soft 达 55.8/55.8。专家演示 $R_{\max}$ 中位数 0.433、95 分位 0.713、零违例,确认违例来自策略而非监督数据。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| Object-Soft 分布内抓放 | TSR / DSR (%) | 最优为 FastWAM VT-C:57.6 / 54.4 | Diffusion Policy VO-C:37.4 / 33.6;π0.5 VT-C:41.4 / 35.0 | TSR +20.2 点、DSR +20.8 点;且 FastWAM 的 TSR−DSR 差距仅 3.2 点(违规占成功 5.6%),远低于 Diffusion Policy 的 9.6 点(24%) |
| Spatial-Soft 分布内抓放(语言指定目标实例) | TSR / DSR (%) | 最优为 FastWAM VT-C:56.4 / 56.0 | π0.5 VO-C:26.0 / 22.6;Diffusion Policy VT-C:33.0 / 25.0 | TSR +23.4~+40.8 点;FastWAM 的 TSR 与 DSR 仅差 0.4 点(500 条中 2 条),为『成功与安全可对齐』提供了存在性证明 |
| π0.5 传感×控制交叉消融(Object-Soft) | TSR / DSR (%) | VO-C:41.6 / 38.4;VT-B:41.0 / 28.0;VT-C:41.4 / 35.0 | VO-B:30.2 / 27.2 | TSR 上连续控制(+11.4)与触觉(+10.8)单独效果相当、合并无叠加,说明表观触觉增益可被控制粒度完全解释;DSR 上 VO-C 反而比 VT-B 高 10.4 点 |
| OOD 汇总评测(9 个单因子条件,Object-Soft) | TSR / DSR (%),Δ 相对 ID | π0.5 VT-C:41.0(Δ−0.4)/ 34.2(Δ−0.8);FastWAM VT-C:55.8(Δ−1.8)/ 55.8(Δ+1.4) | π0.5 VO-C:35.8(Δ−5.8)/ 33.2(Δ−5.2);FastWAM VO-C:54.4(Δ−7.6)/ 53.8(Δ−4.2) | 触觉把 OOD 性能衰减从约 6–8 点压缩到 2 点以内,FastWAM VT-C 的 DSR 甚至超过其 ID 水平 |
| OOD 汇总评测(Spatial-Soft) | TSR / DSR (%),Δ 相对 ID | FastWAM VT-C:39.4(Δ−17.0)/ 38.8(Δ−17.2);π0.5 VT-C:28.4(Δ+0.8)/ 23.2(Δ+1.2) | FastWAM VO-C:27.8(Δ−9.2)/ 27.2(Δ−9.4);π0.5 VO-C:24.4(Δ−1.6)/ 19.4(Δ−3.2) | FastWAM VT-C 绝对值领先 11.6 点,但 ID 下 VT 本就更强(56.4 vs 37.0),提示触觉在 ID 与 OOD 的收益结构不同 |
局限与改进
作者承认的局限:$\tau_o$ 是为仿真基准定义的操作性判据,不是材料破坏或真实世界的损伤阈值;刚体套件的视触觉结果是从连续策略 checkpoint 解码二进制夹爪得到的,只能作旁证而非原生训练;Diffusion Policy 不支持语言条件,在靠指令区分两个同款实例的空间套件上天然被混淆。我自己的观察:全部实验在 Isaac Sim + TacEx 仿真触觉中完成,Sim-to-Real 的触觉差距完全未知;任务局限于 40 个抓放任务,没有布料、绳结、折叠等强形变操作;DSR 只惩罚峰值形变,不考察形变速率、永久变形或接触力分布,一条先轻后猛超限的轨迹与全程贴边的轨迹在这项指标下无差别;90 分位校准的选择有一定任意性,附录虽提供敏感性分析但未给出替代定标;π0.5 加触觉在 ID 下几乎无收益,说明触觉融合本身仍是未解决的建模问题,本基准诊断了这一点但没有给出解决路径。
独立分析的弱点
独立分析的弱点:其一,评测完全依赖 FEM 真值,而真实机器人上没有现成等价物——真实形变需要靠多视角视觉重建或嵌入式传感来估计,估计误差会直接进入判据,这是把基准推向现实的最大障碍;改进方向是研究基于点云跟踪或神经隐式表示的形变估计器,并量化其与 FEM 真值的一致性。其二,抓放任务的形变风险集中在抓取瞬间,缺乏擦拭、倾倒、穿线等需要持续精细接触的任务,DSR 在这类任务上的判别力未经验证;可扩展套件覆盖。其三,只看峰值 $R_{\max}\le 1$,无法区分『先轻后猛、短暂超限后恢复』与『全程贴边』的轨迹,可引入时间加权形变或永久变形判据。其四,容限分位(90%)与归一化方式(包围盒对角线)的选择影响绝对数值,跨基准比较仍无标准,尽管附录提供了再打分工具。其五,策略样本只有三个家族、12 个 ID 配置,『触觉增益被控制粒度解释』等关键结论只在 π0.5 上得到验证,结论的边界条件不明,扩散策略与世界模型上未必同构。其六,双指平行夹爪是唯一末端执行器,灵巧手操作的触觉-形变关系可能完全不同。
未来方向
作者提出之外可延伸的方向:第一,真实机器人版本——用真实 GelSight/数字触觉传感器采集策略可见流,用多视角相机或结构光扫描重建独立形变真值,验证 DSR 在硬件上是否保持判别力。第二,把形变合规性引入训练而非仅评测,例如用隐藏 FEM 流做辅助监督信号或构造形变感知奖励,训练『天生轻柔』的策略;FastWAM 的小 TSR−DSR 差距说明这是可优化的目标而非固有代价。第三,主动触觉:让策略在抓取后依据触觉反馈主动调整闭合度滑向安全窗口,把 DSR 从静态指标变成闭环控制信号。第四,扩展到布料、食物、生物组织等各向异性、黏弹性材料,以及多物体堆叠与密集接触场景,检验单物体标定范式的适用边界。第五,利用发布的评测者专用流研究『最小触觉表征』问题——RGB、marker 场、低维接触统计等哪种表征对形变合规贡献最大。第六,探索容限与任务语义的关联,让 $\tau_o$ 可以由『这是鸡蛋还是面团』这类语言指令指定,把 DSR 变成语言可调的安全约束。
复现评估
复现条件较好。代码与项目页开源(github.com/TuojingAI/SoftVTBench,softvtbench.github.io),基于 Isaac Sim / Isaac Lab 构建,触觉渲染依赖 TacEx + Taxim + FOTS,均为公开组件。数据方面发布 4,000 条演示及评测者专用 FEM/接触/掉落流,论文明确支持『重算、审计或重定义形变判据而无需重新采集』,并附每资产校准参数与不同校准百分位的再打分程序;评测固定 episode、初始状态与 seed,所有方法在同一批 episode 上打分,结果可精确复现——例如 TSR−DSR 差异可直接换算为精确的 48/40 条 episode 数。难点在算力与工程量:训练 π0.5 与 FastWAM 这类 VLA/世界-动作模型通常需要多卡 GPU;FEM 体网格仿真加 20 Hz 多流渲染的存储与计算开销不小;完整复现消融还需按 2×2 传感×控制矩阵训练多套模型。总体属于『数据齐全、工程量大』的中等偏难复现,复现指标榜单(TSR/DSR 本身)则相对容易。
论文图表
上半部分:4,000 条演示覆盖四个诊断套件、50+ 资产(含体可变形物体与视觉匹配的刚体孪生)及人工质检流程。左下:用于闭环泛化评测的受控视觉与物理偏移。中下:由触觉捕获、由物体形变评估的物理交互区间——从易滑移的松抓取(Too Loose: Drop)、稳定安全窗口(Safe Window: Stable)到过度压缩(Too Tight: Over-deform)。右下:同步的视觉、触觉、本体感知、语言与动作流示例。
一图总览论文的全部组成要素:数据规模、刚柔对照、『从打滑到过压』的交互区间概念、以及多模态数据流。理解了这张图就理解了论文要解决什么、用什么资源回答。