浙大学术头条
25-10-22 10:00 微博认证:浙江大学出版社有限责任公司

#每日一篇学术文章#【RevFB-BEV: Memory-Efficient Network With Reversible Swin Transformer for 3D BEV Object Detection】(RevFB-BEV:一种基于可逆 Swin Transformer 的内存高效三维鸟瞰图目标检测网络)http://t.cn/AXwiYhue
鸟瞰视图 (BEV) 的感知因其空间和维度的一致性,已成为 3D 物体检测中广泛采用的方法。然而,神经网络架构日益复杂,导致训练内存需求增加,从而限制了模型训练的可扩展性。为了应对这些挑战,我们提出了一个新模型 RevFB-BEV,该模型基于可逆 Swin Transformer (RevSwin),结合前向-后向视图变换 (FBVT) 和激光雷达引导反向投影 (LGBP)。该方法包含 RevSwin 主干网络,它采用可逆架构,通过重新计算中间参数来最小化训练内存。此外,我们引入了 FBVT 模块,该模块可以细化从前向投影中提取的 BEV 特征,从而产生更密集、更精确的相机 BEV 表示。LGBP 模块进一步利用激光雷达 BEV 引导进行反向投影,以获得更精确的相机 BEV 特征。在 nuScenes 数据集上进行的大量实验表明,我们的模型性能显著提升,达到了4×训练记忆的减少和12×单主干训练内存减少。随着网络架构的加深,这些效率提升将更加显著。此外,RevFB-BEV 在验证集上实现了 68.1 mAP(平均精度),在测试集上实现了 68.9 mAP,这几乎与基线 BEVFusion 相当,凸显了其在资源受限场景下的有效性。

来源 :IET Cyber-Systems and Robotics

发布于 浙江