论文
AMARIS:用于基于 Rubric 的强化学习的记忆增强 Rubric 改进系统
AMARIS: A Memory-Augmented Rubric Improvement System for Rubric-Based Reinforcement Learning
摘要
基于Rubric的奖励塑造通过强化学习(RL)为微调 LLM提供可解释和可编辑的奖励信号,但现有的自适应Rubric方法通常会根据本地证据(例如当前批次或实例级比较)更新标准。这种本地视图丢弃了训练期间产生的诊断信息,使得跟踪重复出现的故障、评估以前的标准编辑或在早期标准饱和后提高标准变得困难。我们推出了 AMARIS,一种记忆增强评分标准改进系统,该系统将评分标准更新建立在纵向训练证据的基础上。 AMARIS 将采样轨迹分析、步骤级摘要和评分标准更新记录存储在持久评估记忆中,然后检索最近的语义相关历史记录以修改评分标准。我们在全球和特定实例的评分标准设置下评估科学、医学、指导遵循和创意写作方面的 AMARIS。 AMARIS 比静态、局部自适应和记忆消融的基线有所改进,例如在 GPQA-Diamond 上比最强基线+2.8 分,在 IFBench 上比最强基线+2.2 分,而分析表明,记忆减少了反复波动的评分标准修改,并支持从早期错误纠正到后期课程进展的进展。 AMARIS 与正常的 RL 循环一起异步运行,相对于同步评分标准更新减少了阻塞延迟。