论文

SERPO:面向开放式测试时强化学习的自演进评分标准策略优化

SERPO: Self-Evolving Rubric Policy Optimization for Open-Ended Test-Time Reinforcement Learning

模型训练强化学习

摘要

测试时强化学习(TTRL)使语言模型在没有标注反馈的推理阶段自我改进。现有方法依赖答案投票,但开放式生成的有效回答无法统一为共同标准答案。没有外部奖励模型或更强评判模型时,适应过程必须从模型自身输出构造可靠奖励。论文提出自演进评分标准策略优化 SERPO,以共同演进回答证据、问题专属评分标准与策略参数的闭环替代答案投票。好—一般—差回答演进将差异最大的采样轨迹组织为有序档案;评分标准演进保留能区分这些档案的条件;概率条件评分将判定词元的似然转为奖励信号;策略演进利用该信号优化策略模型。新策略生成的轨迹更新档案和评分标准,完成三方演进循环。在两种模型配置、两个域内和四个分布外基准中,相对对应基础模型,HealthBench 与 ResearchQA 分数最高分别提高 20.63 和 20.31 分,六项基准宏平均最高提高 8.06 分,并支持分布外迁移与持续跨基准演进。