Flux3发布了。
黑森林工作室好久没消息了,这次终于拿出一个模型。
这个模型支持视频、图片、音频和动作预测,是一个综合的多模态模型。
还在评估模型的早期,后面会发布一个叫flux3-dev的开源模型。
那这模型估计就很大了,未必能在本地跑起来,还是希望发布一个轻量级开源模型,否则本地跑不了。
下面是项目官方的介绍。
在视频方面,在追赶seedance2.0,支持的功能包括:
文本转视频生成。
图像到视频生成,要么从起始帧(“动画”)继续,要么使用图像作为视觉参考。
从参考片段生成视频到视频,将源视频的核心元素——例如同一角色——带入新的场景或上下文。
从输入视频和音频实现生成视频-音频延续。
关键帧生成视频,用于定义时刻之间的受控过渡。
多语言对话。
视觉风格和画面比例广泛,远超传统电影作品。
将单个片段串联成更长的多镜头序列。
风格多样性——FLUX 3 Video轻松处理从自然摄像机画面到动画和电影的各种风格。
出色的字体生成和动画设计。
图片方面:
FLUX 3 可以合成和编辑多种风格、宽高比和分辨率的图像。在中期训练期间进行的初步评估中,FLUX 3 已经比早期版本有了显著提升:其处理复杂提示和文本生成的能力有了显著提升。该模型能够产生多种输出风格(见以下示例),并能够以多种语言渲染高精度文本。
动作预测:
FLUX 3 的世界观理解延伸到动作预测。我们采取了两条路径:直接将原生动作预测整合进FLUX 3,扩大我们在Self-Flow中的初步工作;并利用预训练视频骨干作为动态感知基础,使专业动作模型能够在有限的任务特定数据下进行微调。 http://t.cn/AX9NfiB4
发布于 江苏
