微手势是一种难以察觉的非言语行为,具有运动幅度微弱的特征。然而,其低运动强度、短持续时长的固有特点,给传统动作识别模型带来了巨大挑战。针对这一问题,本文提出受Mamba启发的微手势线性注意力模型(MGMILA)。该模型是一种具备运动感知能力的框架,融合了Mamba启发式线性注意力机制(MILA),是专为视频微手势识别优化的线性复杂度模型。此外,本文设计了多种运动提取模块变体:运动即层(MAL)、运动即内容(MAC)与运动即门控(MAG),用以增强时空运动定位能力。同时,引入人体分割掩码预测作为辅助任务,引导网络聚焦人体相关区域,进而提升模型的运动感知与识别性能。在iMiGUE、自发微手势数据集(SMG)与MA-52数据集上开展的实验结果表明,该方法取得了当前最优性能(SOTA),验证了所提方案的有效性。相关成果已发表于《机器智能研究(英文)》2026年第2期"微视觉计算"专题中。http://t.cn/AXiVMnsb #机器学习[超话]##人工智能[超话]##微手势#
发布于 北京
