开源项目

ScoreCentering:处理离策略强化学习中的评分权重

martin-marek/score-centering

模型训练强化学习

概述

ScoreCentering 提供强化学习中的分数居中方法,面向训练策略与推理策略不一致的离策略场景。 实现可以与重要性采样结合,处理这种分布不匹配带来的训练稳定性问题。使用方可以在相同任务与采样条件下比较训练曲线和最终效果,区分算法变化与其他配置变化。