针对张雨霏发布AI模仿哈兰德的视频,她很可能使用了结合面部替换/深度伪造(Deepfake) 与AI语音克隆技术的综合性软件,例如结合了类似“Reface”或“DeepFaceLab”等换脸工具,以及“ViiTorVoice”等最新AI语音合成模型,来实现从外形动作到声音语调的全方位神还原。
一、事件背景:一次“双圈”梦幻联动
2026年7月8日,中国游泳奥运冠军张雨霏在其个人社交媒体上发布了一段AI模仿视频,瞬间引爆网络。视频中,张雨霏不仅精准复刻了挪威足球巨星哈兰德的标志性动作,还配文“对不起哈宝,我就是玩一玩”,调皮互动引发了大量关注和讨论。这并非一次简单的模仿,而是借助前沿AI技术实现的跨界整活,展现了“蝶后”赛场外的活泼一面。
二、核心技术拆解:从“形似”到“神似”
要实现如此逼真的AI模仿,通常需要组合多种AI技术,而非单一软件完成。
1. 面部与动作模仿:AI换脸与动作迁移
核心软件:可能会使用如 DeepFaceLab、Reface 或 FaceFusion 等主流深度伪造(Deepfake)软件。
技术原理:这类软件基于生成对抗网络(GANs) 或自编码器。通过大量收集哈兰德和张雨霏的面部数据,训练一个模型,将张雨霏的面部特征与哈兰德的脸型、表情进行映射和替换。
应用难点:要完美复刻哈兰德那种“身体前倾、双臂僵直摆动”的魔性“魔人步”,不仅需要换脸,还需进行动作迁移(Motion Transfer)。这要求软件能捕捉并驱动视频中人物的身体姿态和步态,将张雨霏的肢体运动替换或叠加成哈兰德的标志性动作。
2. 声音与语调克隆:AI语音合成
核心软件:可能使用了近期登顶全球语音评测榜首的国产模型 ViiTorVoice,或类似的开源模型如 CosyVoice、Fish Audio 等。
技术原理:语音克隆(Voice Cloning) 技术。ViiTorVoice模型具备强大的“片段级定向编辑”能力,可以仅需几秒的哈兰德原始音频样本,就能克隆出其独特的声线、语调和呼吸节奏。
关键突破:ViiTorVoice能实现“局部编辑”,即在不重新生成整段音频的情况下,修改特定词句的音色与节奏。这使得视频配音能完美匹配哈兰德的语气,甚至能生成那句“对不起哈宝”这样充满个人风格的台词。
三、工作流程与软件推测
综合现有AI技术,张雨霏团队或她本人可能采用了以下流程:
数据采集:从哈兰德的比赛、采访和广告中,截取大量清晰的正面、侧面面部视频以及高保真音频素材。
模型训练:利用DeepFaceLab等软件,基于采集的数据训练一个“张雨霏→哈兰德”的面部转换模型,以及一个哈兰德的语音克隆模型。
视频制作:
第一步:张雨霏拍摄一段自己模仿哈兰德走路、摆动作的原始视频。
第二步:使用训练好的面部转换模型,将原始视频中张雨霏的脸替换为哈兰德的脸。
第三步:利用语音克隆模型,为替换后的视频生成哈兰德风格的配音。
第四步:进行后期合成与精修,确保口型、动作与音频高度同步,完成最终效果。
四、技术背后的易用性趋势
ViiTorVoice等新一代AI工具的出现,大大降低了技术门槛。其官网提供的“AI会说话的照片”和便捷的视频配音功能,让即使没有深厚技术背景的普通人,也能通过简单的在线操作,制作出高质量的AI模仿视频。这表明,张雨霏的视频很可能并非依靠复杂的线下技术团队,而是借助了这些越来越“傻瓜化”的在线AI平台。