Black Forest Labs 发布了 FLUX 3 多模态视频生成模型,看效果很不错啊。
1、单词生成可达 20 秒,带有原生音频,支持文生视频,图生视频,视频生视频,关键帧过度以及视频音频的延续生成。
2、多语言对话生成能力,精准的人类面部表情捕捉,匹配声音和物理事件。
3、支持将多个片段链接成几分钟且角色一致的长镜头。
4、FLUX 3 DEV 将在未来几周开源,目前需要申请早期访问,未来几个月内会逐步开放 音频和图片生成的 API。
传送门:bfl.ai/blog/flux-3
#HOW I AI##科技先锋官# http://t.cn/AX9oiL3i
发布于 北京
