Simon的白日梦
26-10-04 15:42 微博认证:科技博主

这个case好有意思,教大语言模型如何“一笔一笔”地把水彩花朵“画”出来。🥹

用 TRL 把写代码的模型训成画水彩

Sergio Paniego 2026-09-03 在 Hugging Face 上公开复现 Surya Narreddi 的病毒视频:语言模型不直接出图,而是写大约 150 行 JavaScript,调用 p5.brush 的十个方法,在画布上铺水彩。原视频当时超过 150 万次播放,原作者的完整技术报告还没开。这篇把参考池、RL 环境和训练脚本都放出来了。底座是 Qwen3.5-35B-A3B 的 LoRA,用 GRPO。奖励四项:能编译、真的上色、不作弊,占 0.05;代码稍长,0.05;视觉模型对照四张参考判风格,0.60;HPSv3 审美分,0.30。参考池 178 张,全是四个开源模型对着 iNaturalist 的扶桑照片写出来的,作者再手分成 love 和 okay。池子里没有一张人手画的水彩。

学到的第一件事是少交废图。只靠 HPSv3,中位数变稳,好图几乎不加分。把对照评判的权重加上去,顶部才靠近他标过喜欢的那些,颜料覆盖大约翻倍。系统提示要求画 15 到 30 个形,模型实际平均 7 到 9 个,因为奖励不为这句话付钱。超时和评分器没响应曾被记成 0,等于把故障当成烂画,后来改成整条剔除。他自己看,judge-led 最杂、也最有意思;hps-only 颜色收得最死。

🔗 链接:http://t.cn/AXWoKwwK

品味被写成可训练。池子决定什么算好,也决定它只会画那一朵花。

发布于 广西