作者使用 Qwen3.5-35B-A3B 进行 RL 来生成更漂亮的花朵水彩画。核心观点是奖励的设置,也就是人类审美如何被泛化为有效的信号。让视觉模型当评委的缺点是,如果是直接打分,最终会拉不开美丑的区分度;最后改为两两对比,以胜率作为奖励信号。文章还提到用 GEPA 优化了系统提示词,不是越详细越好。
作者使用 Qwen3.5-35B-A3B 进行 RL 来生成更漂亮的花朵水彩画。核心观点是奖励的设置,也就是人类审美如何被泛化为有效的信号。让视觉模型当评委的缺点是,如果是直接打分,最终会拉不开美丑的区分度;最后改为两两对比,以胜率作为奖励信号。文章还提到用 GEPA 优化了系统提示词,不是越详细越好。
在本文中,作者将强化学习应用于创意绘图任务,训练语言模型通过编写代码来生成水彩图像。文章指出传统强化学习依赖客观可验证的胜负或对错信号,而面对主观的审美设计任务时,关键在于精心构建奖励机制,使模型的艺术品味既能泛化又不会失控漂移。
GRPO 在本文中被用作四步训练闭环里的强化学习策略更新算法。当生成的绘图脚本被沙盒环境渲染为图像、并由裁判模型与参考图比对转化为奖励信号后,系统便通过 GRPO 对语言模型进行参数更新,从而迭代提升其水彩编程能力。
奖励函数是本文引导模型掌握水彩画审美的核心模块。作者废弃了最初包含 9 项指标且易导致模型停滞的绝对评分机制,重构为结合编译检查、代码长度、HPSv3 和参考池成对裁判(占比 60%)的相对评估体系,使训练收敛速度提升 3 倍并大幅精简了生成代码。
p5.brush 是本文中模型用于编写水彩画代码的目标 JavaScript 库。作者发现提供多达 400 行的完整 API 文档会导致模型频繁幻觉出不存在的接口,最终通过提示词演化将其精简为仅包含 8 个笔刷方法的严格白名单,模型才成功稳定作画。
在本文中,原生 p5.js 作为底层绘图框架被提及。作者在奖励函数的代码编译门控中专门设置了校验规则,用于确保模型调用的是更具艺术表现力的 p5.brush 库,而不是退化回基础的原生 p5 代码来绘制简陋图形。
在本文构建的强化学习训练闭环中,Puppeteer 被用作沙盒化渲染工具。它负责执行模型生成的 p5.brush 绘图代码并将其渲染导出为 PNG 格式图像,以便后续视觉裁判模型对图像质量进行对比与打分,起到了连接代码工件与视觉评估的桥梁作用。
HPSv3 是文中使用的人类偏好评估模型,作为强化学习的奖励信号之一。在初始评价标准中其权重仅占 0.10,导致模型陷入瓶颈;重构评价体系后,其实际有效的美学方差被重视,权重提升至 0.30,有效辅助了代码绘画的美学质量优化。
GEPA 是作者用于系统提示词演化的提示词优化库。作者通过 GEPA 进行了 200 次评分迭代,成功将原先容易引发模型幻觉的 400 行 API 文档精简为仅包含 8 个核心绘图方法的严格白名单,显著降低了代码生成中的 API 编造问题。
在本文构建参考画作池的自动化研究流程中,VLM(视觉语言模型)担任视觉裁判。它依据真实参考照片对各前沿模型生成的水彩画进行打分与反馈指导,助力团队批量生成并筛选出高质量的水彩参考数据集。
这是作者用来替代 0 到 10 分绝对评分的成对比较机制。裁判模型将生成画作与人类筛选出的参考图进行对比并判定优劣,以胜率计算奖励。该方法解决了绝对打分动态范围压缩的问题,在新奖励规则中占比 0.60,使模型训练收敛速度提升并大幅精简了冗余代码。
在本文中,作者将强化学习应用于创意绘图任务,训练语言模型通过编写代码来生成水彩图像。文章指出传统强化学习依赖客观可验证的胜负或对错信号,而面对主观的审美设计任务时,关键在于精心构建奖励机制,使模型的艺术品味既能泛化又不会失控漂移。
RLHF(基于人类反馈的强化学习)在文中被作者视为后续优化的理想方案。作者指出,相比于每次在训练循环中实时与参考图池做成对对比,更标准的做法是基于人工评分数据直接训练一个审美奖励模型,以此将主观品味内化并指导模型学习。
本文作者,常驻纽约布鲁克林的设计师与创意技术专家。他主导了利用强化学习训练大模型编写 p5.brush 代码作画的研究项目,旨在打破传统 AI 生图只能通过 Prompt 调整的局限,让绘画产物转化为可细粒度编辑的代码,并深入探索了主观美学任务中奖励函数的设计方法。
Cameron Franz 是该项目的核心合作者。他与作者共同探索将强化学习(RL)应用于创意与设计任务,合作训练了一个通过编写 p5.brush 代码生成水彩图像的语言模型,并协助搭建了完整的训练基础设施,使图像的底层生成代码具备可直接细粒度编辑的特性。
可左右滑动查看