Christen Millerdurai, Diogo Luvizon, Viktor Rudnev, André Jonas, Jiayi Wang, Christian Theobalt, Vladislav Golyanik
从单目视频进行 3D 手部追踪是一个极具挑战性的问题,主要难点在于手部交互、遮挡、左右手歧义以及快速运动。现有大多数方法依赖于 RGB 输入,而 RGB 输入在低光照条件下存在严重局限,并且容易受到运动模糊的影响。相比之下,事件相机(Event Camera)捕捉局部亮度变化而非完整图像帧,不受上述问题影响。然而,由于数据模态的显著差异,现有的基于图像的技术无法直接应用于事件数据。
针对这些挑战,本文提出了首个基于单目事件相机对两只快速运动且相互交互的手进行 3D 追踪的框架。该方法通过一种新颖的半监督特征级注意力机制来解决左右手歧义问题,并引入交叉损失(intersection loss) 来修正手部碰撞。
为促进该研究领域的发展,作者发布了两个新数据集:
- Ev2Hands-S:大规模合成数据集,包含两只交互手部的数据;
- Ev2Hands-R:真实基准数据集,包含真实事件流及 3D 真值标注。
实验表明,该方法在 3D 重建精度上优于现有方法,并且能够在极端光照条件下的真实数据上有效泛化。