论文

从稀疏现实结果学习的评分细则监督评估器模型

A Rubric-Supervised Critic from Sparse Real-World Outcomes

模型训练奖励建模与过程监督

摘要

编码智能体的学术基准倾向于奖励自主任务完成,以单元测试通过等可验证奖励衡量。相比之下,现实中的编码智能体在人在回路中运行,成功信号通常嘈杂、延迟且稀疏。如何弥合这一差距?本文提出一个从稀疏嘈杂的交互数据学习“评论家”模型的流程,随后既可作 RL 训练的奖励模型,也可用于推理时扩展。具体地,我们提出 Critic Rubrics,一个基于量规的监督框架,含 24 个仅从人机交互轨迹即可导出的行为特征。借助半监督目标,我们可联合预测这些量规与稀疏的人类反馈(如存在)。实验中,我们表明,尽管这些评论家主要由轨迹可观测的量规和稀疏现实结果代理训练,它们仍能改进 SWE-bench 上的 best-of-N 重排(在可重排轨迹子集上 Best@8 较 Random@8 高 15.9),支持提前停止(+17.7 且尝试次数减少 83%),并支持通过评论家选择轨迹做训练期数据治理。

从稀疏现实结果学习的量规监督评论家模型
图1:我们的方法概览:从生产轨迹中学习可部署的critic。我们将真实世界的人–智能体交互转换为片段(用户请求 → \rightarrow 智能体动作 → \rightarrow 结束),为每个片段标注可从轨迹观测的Critic Rubrics(24个密集行为信号),并将其与稀疏的生产结果代理指标(如PR合并/代码存活)相结合,训练一个半监督、多任务的critic,同时预测rubric特征与片段成败。所得critic支持best-of- K K 重排序、计算高效的提前停止,以及用于训练期数据筛选的轨迹选择。