原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2608.27906
立即前往原文

RCCA 改进代码生成强化学习中的信用分配

该研究提出了 Rubric-to-Code Credit Assignment(RCCA),一种面向强化学习的框架,用于让模型根据自然语言需求生成可用的 HTML、CSS 和 JavaScript 应用。RCCA 不再将单一的序列级奖励平均应用于所有 token,而是把功能反馈对应到相关代码区域和生成 token。其分层奖励机制区分格式、源代码、运行时和功能错误。Ling-RCCA-Flash 在 MiniAppBench 上获得 41.25 分,在 ArtifactsBench 上获得 76.19 分。根据研究报告,在官方 ArtifactsBench 排行榜设置下,该模型超过了包括 GPT-5 得分在内的既有基准。
行业资讯 应用 AI模型 研究 2026-08-31 10:30:55 429 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。