爱可可-爱生活
24-01-31 06:48 微博认证:AI博主 2025微博新锐新知博主

[CV] Divide and Conquer: Language Models can Plan and Self-Correct for Compositional Text-to-Image Generation
http://t.cn/A6jWTXP8
介绍了一种名为CompAgent的训练无关方法,用于解决复杂文本描述下的组合文本到图像生成问题。该方法利用大型语言模型作为核心,通过分而治之的方法,将复杂的文本提示分解成独立的对象,并通过规划和工具使用将它们组合成最终的图像。实验证明,CompAgent在组合文本到图像生成任务上具有优势,并在开放世界组合文本到图像生成基准测试上取得了10%以上的改进。

发布于 北京