论文

面向强化学习的评分准则到代码贡献分配

Rubric-to-Code Credit Assignment for Reinforcement Learning

模型训练强化学习RLVR

摘要

交互式 Web 应用程序生成需要模型根据自然语言请求生成可用的 HTML、CSS 和 JavaScript 应用程序。与传统的代码生成不同,应用程序质量取决于多个面向用户的功能需求,每个需求通常与本地化代码区域相关,例如事件处理程序、状态更新、DOM 片段或 CSS 选择器。标准 GRPO 将这些结构化结果分解为单个序列级奖励,并将所得优势统一应用于所有token,从而削弱信用分配。我们提出了 \textbf{Rubric-to-Code Credit Distribution} (RCCA),这是一种强化学习框架,可将 rubric 级别的功能反馈转换为生成代码上的本地化优化信号。 RCCA 围绕显式功能规则构建训练任务,使用分层奖励来分离格式、源代码、运行时和功能故障,并将评估者生成的文本属性与负责任的代码跨度和生成的标记保持一致。生成的模型 \textbf{Ling-RCCA-Flash} 在 MiniAppBench 上得分为 41.25,将 Ling-3.0-Flash 提高了 32.20 分,略高于 Claude Opus 4.5。它还在 ArtifactsBench 上达到了 76.19,将 SFT 模型改进了 4.48 分,并在官方 ArtifactsBench 排行榜设置下建立了新的最高分,超过了 GPT-5 分数 3.64 分,这表明可转移的实现级别收益。