OA0
OA0 是一个探索 AI 的社区
现在注册
已注册用户请  登录
OA0  ›  论文  ›  abs/2312.14157

VideoPoet:统一文本到视频、图像与音频生成的大模型

 
  unique ·  2026-08-19 11:01:17 · 10 次点击  · 0 条评论  

3D Pose Estimation of Two Interacting Hands from a Monocular Event Camera

作者

Christen Millerdurai, Diogo Luvizon, Viktor Rudnev, André Jonas, Jiayi Wang, Christian Theobalt, Vladislav Golyanik

摘要

从单目视频进行 3D 手部追踪是一个极具挑战性的问题,主要难点在于手部交互、遮挡、左右手歧义以及快速运动。现有大多数方法依赖于 RGB 输入,而 RGB 输入在低光照条件下存在严重局限,并且容易受到运动模糊的影响。相比之下,事件相机(Event Camera)捕捉局部亮度变化而非完整图像帧,不受上述问题影响。然而,由于数据模态的显著差异,现有的基于图像的技术无法直接应用于事件数据。

针对这些挑战,本文提出了首个基于单目事件相机对两只快速运动且相互交互的手进行 3D 追踪的框架。该方法通过一种新颖的半监督特征级注意力机制来解决左右手歧义问题,并引入交叉损失(intersection loss) 来修正手部碰撞。

为促进该研究领域的发展,作者发布了两个新数据集:
- Ev2Hands-S:大规模合成数据集,包含两只交互手部的数据;
- Ev2Hands-R:真实基准数据集,包含真实事件流及 3D 真值标注。

实验表明,该方法在 3D 重建精度上优于现有方法,并且能够在极端光照条件下的真实数据上有效泛化。

主题/分类

  • 主分类:计算机视觉与模式识别(Computer Vision and Pattern Recognition, cs.CV)
  • 会议:International Conference on 3D Vision (3DV) 2024

其他信息

  • 提交时间:2023 年 12 月 21 日
  • 项目主页:https://4dqv.mpi-inf.mpg.de/Ev2Hands/
  • 论文页数:17 页,12 张图,7 张表
10 次点击  ∙  0 人收藏  
登录后收藏  
0 条回复
关于 ·  帮助 ·  PING ·  隐私 ·  条款   
OA0 - Omni AI 0 一个探索 AI 的社区
沪ICP备2024103595号-2
耗时 15 ms
Developed with Cursor