零重力瓦力
26-05-09 16:43 微博认证:AI博主

Black Forest Labs 的 Stephen Batifol 介绍了 FLUX 发展的路线图。这家公司其实就是 Stable Diffusion 和 Latent Diffusion 背后的团队,学术引用超过 20 万次,合作方包括 Microsoft、Adobe、Canva 这些大厂。

去年 8 月 FLUX.1 开源发布,文生图直接能在笔记本上跑,人体结构吊打同期一堆更大的模型。紧接着 Kontext 发布,把文生图和图像编辑塞进同一个模型里,生成只要 7 到 8 秒,同期 GPT 图像生成还要 40 多秒。11 月的 FLUX.2 更猛,生成质量到了肉眼几乎分不出 AI 痕迹的程度,同时支持最多 10 张参考图。今年 1 月的 Klein 版本把延迟压到了生成 300 毫秒、编辑 500 毫秒,基本是实时交互的水平,质量和 Qwen 等开源模型持平但速度快了 30 倍。

而一个半月前他们公开了自己的研究论文 Self-Flow。传统生成模型训练靠外部编码器做表征对齐,比如用 DINOv2 教模型理解“杯子应该在桌上而不是穿过桌子”。问题在于外部编码器有扩展上限、模态受限、目标不一致,更好的编码器反而可能导致更差的训练结果。Self-Flow 的做法是用学生-教师架构,对同一素材加不同程度的噪声,让模型在一个流程里同时学习生成和表征,完全不依赖外部编码器。实验结果在图像、视频、音频三个模态上全面超过基线,收敛更快且没有平台期,文字渲染和人体结构这些老大难问题也明显改善。

更有意思的是,同一个模型还能预测机器人动作。演示里基线模型的机械臂还在乱挥,Self-Flow 训练的版本已经精准抓起罐子移过来了。BFL 的野心是,从图像生成出发,经过视频、音频、多模态联合生成,最终指向世界模型和机器人。用生成式世界模型训练智能体,扩展到自动驾驶和制造业自动化,这才是他们说的“视觉智能”的终局。

Self-Flow 这篇论文解决的是生成模型“知其然不知其所以然”的根本问题,而且方法足够优雅,一个架构就能通吃所有模态,扩展性没有天花板。将图像生成这条赛道的竞争从“谁更好看”转向“谁真正理解物理世界”。

#FLUX##世界模型##AI创造营# http://t.cn/AXJFcYI7

发布于 上海