在 MiniMax H3 里,这两个是两种不同的模型变体,缩写可以这样理解:
FL2VA = First & Last Frame → Video + Audio
F = First Frame,首帧
L = Last Frame,尾帧
2 = to
V = Video
A = Audio
可以理解为:首帧/尾帧条件 → 带音频的视频生成
它同时承担 H3 的普通 T2VA(Text → Video + Audio)、首帧图生视频,以及首尾帧生视频。官方将 fl2va 单独作为一个 model variant。MiniMax
Ref2VA = Reference → Video + Audio
Ref = Reference,参考素材
2 = to
V = Video
A = Audio
即:参考素材 → 带音频的视频生成
这里的 Reference 不只是图片,还可以是多张图片、参考视频、参考音频,用于约束人物身份、服装/风格、动作、镜头语言、声音等。MiniMax 官方介绍里,Ref2VA 可以接受最多 9 张图片、3 个视频和 3 段音频作为参考。
发布于 北京
