Simon的白日梦
25-03-30 11:58 微博认证:科技博主

或许是目前最接近gpt-4o用嘴画图的开源实现 (从原理上和效果上):采用大规模多模态模型(LMM)作为共享表征空间,使图像和文本能够更好地对齐,并作为外部扩散模型的条件输入。

DreamEngine: 多模态表征对齐的图像生成框架

🧐 DreamEngine 是一个集成多模态编码器(如 QwenVL)与扩散模型的框架,采用两阶段训练方法,实现文本-图像交错控制,在复杂概念融合的图像生成任务上达到最先进水平。

➡️链接:http://t.cn/A6rPT89O

✨ 重点

● 🚀 核心功能:通过多模态表征对齐(Multimodal Representation Alignment)技术,提升文本到图像的生成效果,支持更精细的控制。

● 🏗 架构:结合多模态编码器(如 QwenVL)和扩散模型,采用两阶段训练策略以提高生成质量。

● 🎨 创新点:能够处理复杂的文本-图像交错控制任务,使得融合多个概念的图像生成更容易。

● 🛠 使用指南:提供 setup.sh 脚本用于本地运行,并附带 demo.py 进行推理测试。

● 🔍 研究背景:目前的文本-图像生成模型主要依赖文本编码器(如 CLIP、T5)与扩散模型,但现有方法在合并多个图像概念时缺乏有效的控制机制。

● 🏗 Dream Engine 方案:采用大规模多模态模型(LMM)作为共享表征空间,使图像和文本能够更好地对齐,并作为外部扩散模型的条件输入。

● 🎯 核心技术:用多模态编码器(如 QwenVL)替换传统的文本编码器,并引入 两阶段训练策略:

第一阶段:联合文本-图像对齐(Joint Text-Image Alignment)。

第二阶段:多模态交错指令微调(Multimodal Interleaved Instruction Tuning)。

● 📊 实验结果:在 GenEval 基准测试中取得 0.69 的总分,表现与 SD3.5 和 FLUX 等最先进模型相当。

#AI白日梦想家[超话]# #ai创造营# #你好人工智能时代# #ai生活指南#

发布于 奥地利