RCCA 改进代码生成强化学习中的信用分配
该研究提出了 Rubric-to-Code Credit Assignment(RCCA),一种面向强化学习的框架,用于让模型根据自然语言需求生成可用的 HTML、CSS 和 JavaScript 应用。RCCA 不再将单一的序列级奖励平均应用于所有 token,而是把功能反馈对应到相关代码区域和生成 token。其分层奖励机制区分格式、源代码、运行时和功能错误。Ling-RCCA-Flash 在 MiniAppBench 上获得 41.25 分,在 ArtifactsBench 上获得 76.19 分。根据研究报告,在官方 ArtifactsBench 排行榜设置下,该模型超过了包括 GPT-5 得分在内的既有基准。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。