论文
CREDO:方差引导的量规演化与回放校正信用分配
CREDO: Variance-Guided Rubric Evolution for Replay-Corrected Credit Assignment
摘要
长程语言智能体只获得稀疏的终端反馈,而中间量规提供结构化但可能规定不当的进度评估。在可重置的训练环境中,反事实续跑 rollout 可以度量局部信用,但穷举回放代价高昂。我们提出 Credo,一个将演化的语义量规与选择性、基于执行的信用校正耦合的框架。冻结的评判器将可见转移映射为量规特征,信用头预测与所实现转移相关的期望终端奖励变化。独立采样的双侧回放按其记录的包含概率校正预测残差。我们推导了条件无偏性和方差分解,把两个设计选择联系起来:保留哪些量规特征,以及在固定期望回放预算下在哪里分配。所得准则按策略分数敏感性和缺失回放覆盖为预测误差加权;其分配规则还考虑续跑成本。我们还描述了与终端留一优势混合的实用方案,并区分其截断、按 token 归一化的 PPO 实现与理想策略梯度估计器。这份初步报告提供方法、证明、一个精确的有限模型审计和一个受控评估协议,不声称在语言智能体基准上具有经验优势。