论文

ECPO:面向证据认证候选排序的证据耦合策略优化

ECPO: Evidence-Coupled Policy Optimization for Evidence-Certified Candidate Ranking

模型训练强化学习RLVR

摘要

用于决策支持场景的排序系统不仅应给出候选排序,还应暴露可独立核查的证据。我们研究证据认证的候选排序:给定intent_id、预定义的计划骨架、窗口局部的候选名册,以及带span出处的文本候选轨迹,系统必须输出Top-K列表以及doc_id:span形式的证据证书,且所引用的span足以复原该决策。我们在MAVEN-ERE和RAMS上实例化该任务,采用固定的上游抽取、窗口局部随机化候选标识符、与骨架对齐的轨迹监督、困难负例以及审计参照。我们提出证据耦合策略优化(Evidence-Coupled Policy Optimization, ECPO),一种列表级策略优化目标,其动作是排序与证据证书的联合对象。ECPO先从骨架对齐、论元一致性与可选图特征中学习可解释的轨迹奖励;随后以三项耦合奖励优化一个受约束的策略:列表级排序效用、span级证书有效性,以及由无标签确定性验证器计算的证据循环奖励——该验证器从剥离主张的引用span中重建候选支持。这将目标从单纯最大化普通NDCG,重新定义为最大化CertNDCG与决策—证据耦合。评估将ECPO与zero-shot、SFT和GRPO策略,仅用RM打分再确定性附加证据,语法/JSON约束解码,验证器重试,best-of-N RM选择,以及事后证据合理化等方法,在封闭名册、预测名册与混合名册设定下进行比较。

ECPO:面向证据认证候选排序的证据耦合策略优化:论文配图
图 1:ECPO 训练循环。该策略对联合排名/证书对象进行采样。验证器强制执行模式和跨度可追溯性,而确定性纯证据验证器则从声明和事件 ID 剥离的引用跨度中重建候选者,并提供证据循环奖励。