论文
从稀疏现实结果学习的评分细则监督评估器模型
A Rubric-Supervised Critic from Sparse Real-World Outcomes
摘要
编码智能体的学术基准倾向于奖励自主任务完成,以单元测试通过等可验证奖励衡量。相比之下,现实中的编码智能体在人在回路中运行,成功信号通常嘈杂、延迟且稀疏。如何弥合这一差距?本文提出一个从稀疏嘈杂的交互数据学习“评论家”模型的流程,随后既可作 RL 训练的奖励模型,也可用于推理时扩展。具体地,我们提出 Critic Rubrics,一个基于量规的监督框架,含 24 个仅从人机交互轨迹即可导出的行为特征。借助半监督目标,我们可联合预测这些量规与稀疏的人类反馈(如存在)。实验中,我们表明,尽管这些评论家主要由轨迹可观测的量规和稀疏现实结果代理训练,它们仍能改进 SWE-bench 上的 best-of-N 重排(在可重排轨迹子集上 Best@8 较 Random@8 高 15.9),支持提前停止(+17.7 且尝试次数减少 83%),并支持通过评论家选择轨迹做训练期数据治理。
