每个方法在每个有力传感器标注的数据集上评测,逐数据集画预测 vs 真值—— 数据集质量在行内被控制,面板之间的差异就是方法之间的差异。
↖ 方法设计 总览(英文) 图库 English| 数据集(gel 类型) | 我们——物理, 零训练帧 |
FEATS U-net (训练域:有点 gel) |
FeelAnyForce (训练域:无点) |
|---|---|---|---|
| FEATS val(有点) | 0.77 | 0.96 · 本域 | 0.43 |
| FoTa cnc_Mini(无点) | 0.94 (视野内) | 0.07 | 0.83 |
| GlowTact(无点) | 0.98 | 0.04 | 0.90 |
规律本身就是发现:每个网络只统治自己的 gel 域,出域即塌 (FEATS 0.96 → 0.04–0.07;FeelAnyForce 0.90 → 0.43); 而物理管线是唯一在所有域都工作的估计器(0.74–0.99)—— 它没见过训练数据,所以也没有可以离开的域。
本域内 FEATS U-net 非常出色(ρ=0.96)——它在别处的失败是域效应, 不是模型弱。FeelAnyForce(无点训练)在有点 gel 上退化到 0.43:这把刀两边都割。
条件苛刻:只有 4 帧无接触,62% 的按压贴边。我们严格视野内 ρ=0.94(MAE 0.26 N,见管线调试页); FeelAnyForce 非边缘达 0.92。
最友好的真值(按压居中、10 帧自由参考、0–20 N)。逐 indenter 在 物理作用域内(接触完全在视野、凝胶未触底)家族内标定后,六种 indenter 的 ρ 为 0.975–0.992,MAE ≤ 0.73 N。注意:该标定逐家族重拟合,衡量的是组内秩一致性, 并非可迁移的绝对牛顿刻度——见逐数据集标定。
10 块 gel pad(6 球、2 平、2 尖),力为牛顿。我们用 GlowTact 标定的表应用到这个外来传感器,视野内 ρ=0.878。改用 Sparsh 自己的球压帧 重建查找表(708 帧,由 a²=d(2R−d) 拟合出 R=2.44 mm)后达到 ρ=0.968,MAE 0.042 N,对照组(pad 内打乱标签)为 0.23。 在一块 pad 上拟合后原样应用到另一块没有可测代价(各处 0.96–0.98): 一张表,六块 gel pad。
为什么"表"比"拟合"更关键:用错传感器的表,球压积分出的是 双瓣+中心凹陷;用自标定的表则是与解析球冠吻合的单一圆顶 (残差 RMS 0.179 → 0.0545 mm)。在任何积分之前测量:LUT 梯度与解析球面 梯度夹角为 93.3°(随机水平是 90°),自标定后降到 4.5° (30° 以内占比 15% → 99%)。反向对照:Sparsh 的表在 GlowTact 帧上同样失败, 所以这是逐传感器属性,而非"我们的表不好"。
代价与仍然失败之处。代价是在目标传感器上采一组带深度记录的 球压:这是每个传感器标定一次,不是零样本。秩序可以跨压头形状迁移,但 绝对牛顿不行——球拟合的模型用到平头上 MAE 退化到 0.37–0.40 N,而且 用正确的表反而更差,因为真实几何拉大了球与平头之间本就存在的特征尺度差异。 尖头不受支持(视野内 ρ 0.58)。剪切在结构上无法覆盖——无论用哪张表, 剪切最高十分位的残差都保持 1.6 倍。帧被限制为接触圆盘可见:36% 的按压检测不到圆盘、 11% 被裁切,而被裁切子集的力中位数最高却得分更差,说明这是可见性问题而非力程筛选。 另外还先修了三个数据集缺陷:flat/sharp 的轨迹里帧索引比力多 5 个(标签会静默错位, 逐轨迹配对前 ρ≈0)、sharp/batch_2 以 BGR 存储而其余九个是 RGB、 flat/batch_2 只有 3 个图像文件。
在我们真正关心的数据集上,两个幸存的估计器——物理(零训练)与 FeelAnyForce(20 万帧)——一致性 ρ=0.91,且物理管线判无接触的每一帧它都读 ≈0 N。 彼此无法抄袭对方的错误。
给 React 打标签(无点 Mini):FeelAnyForce 主标, 物理管线独立审计,分歧行打标。换任何新 gel 或新传感器、没有训练模型匹配该域时: 物理管线是唯一开箱即用的选项——它在 FEATS 数据集上的 0.74 就是"无人为它调过的域"上的表现。
管线调试页:三个数据集上从原始图像到力的逐步展示,以及 cnc 视野消融(视野内 ρ=0.94)。