#科研上新# ICLR上新 | 理论视角分析,语言模型规划中强化学习的收益与陷阱
论文链接:http://t.cn/AXxwfoWi
尽管大语言模型在代码生成等任务上表现卓越,但其在生成图表、网页等视觉导向的代码时,往往只关注功能实现,忽视了布局、色彩和交互等美学维度,导致产出效果不佳。
为应对这一挑战,研究员们提出了一套完整的代码美学优化流程:首先构建了包含约35.8万高质量样本的大规模指令微调数据集AesCode-358K,涵盖Python可视化和网页设计;随后引入“智能体奖励反馈”机制,利用多智能体系统从代码可执行性、静态视觉美感和动态交互体验三个维度进行评估;在此基础上,研究进一步提出GRPO-AR算法,将多维度奖励信号融入强化学习,以联合优化代码的功能性与美学表现,并配套开发了用于系统性评估的OpenDesign基准。
图2:AesCoder流程概述,集成了数据构建、模型训练和加权评分机制。GRPO-AR 通过协调三个专门的奖励智能体(即执行智能体、静态美学智能体和交互式美学智能体)来执行 GRPO,从而实现全面的奖励反馈。
实验结果表明,先在AesCode-358K上进行监督微调,再结合智能体奖励反馈进行强化学习,能显著提升模型在OpenDesign及PandasPlotBench等基准上的表现。最终,仅40亿参数的AesCoder-4B模型在美学质量上超越了GPT-4o和GPT-4.1,其性能甚至可与参数量达480B–685B的超大规模开源模型相媲美,充分验证了该方案在提升代码美学方面的有效性。
发布于 北京
