【浙大联合微软亚研院发布视频识别新方法,可对视频逐帧识别且无需,数据标记,或可用于手语翻译等】
目前,#人工智能# 在视频理解上已经有广泛应用,例如用深度学习帮助视频分类等任务已取得显著成果。不过当下,有关动作表征学习的各种架构主要为识别视频的全局特征而设计。
然而在实际应用中,对于视频的逐帧识别也有着强烈的需求,例如有时希望借助人工智能完成视频对齐、手语翻译、机器人模仿学习等操作。这就对算法提出了更高的要求,能对长达数百帧的长视频建模,与此同时,对该长视频进行逐帧表征识别而不仅是全局特征。
最近,浙江大学计算机辅助设计与图形学(CAD&CG)国家重点实验室联合微软亚洲研究院共同研发了一种新的名为“对比动作表征学习”( contrastive action representation learning,CARL)的框架,通过自我监督的形式对长视频等内容的逐帧动作表征进行学习以及识别。而且,该方法并不需要事先对视频进行标记。
为对该方法进行评估,研究人员通过该方法对目前主流的三种视频数据集 FineGym、PennAction 和 Pouring 进行了实验。实验结果证明,通过该方法在各方面的表现皆优于之前的方法技术,特别是下游细粒度动作分类表现尤为明显。相关论文以《基于序列对比学习的长视频逐帧动作表征》(Frame-wise Action Representations for Long Videos via Sequence Contrastive Learning)为题在 arXiv 上发表[1]。
虽然在此之前,也有其他方法通过监督学习对视频进行逐帧地表征学习与识别。但是,这些方法大多需要对视频中的动作边界或阶段边界进行手动标记,在大规模的数据集中进行这一步骤十分耗时,甚至有些不切实际。因此,这些方法很难在现实场景中得到广泛应用。
该团队此次发布的 CARL 框架,并不需要对视频进行标记。该框架受对比表征学习最新进展的启发,通过自我监督的方式对长视频中具有时空上下文相关的信息进行逐帧表征学习。
戳链接查看详情:http://t.cn/A6XBmpgw
