论文
稍微正确的工具缓存可以逆转组标准化策略更新
Marginally Correct Tool Caches Can Reverse Group-Normalized Policy Updates
摘要
工具结果缓存减少了代理训练中的重复执行,但也使不同采样轨迹的随机性相互耦合。我们研究了一个双动作模型,其中独立和共享执行保留了每条采样轨迹的条件奖励分布。尽管存在这种边际协议,但每个组共享一个随机结果可以逆转预期的组标准化政策更新。我们推导出一个精确的有限群表达式:相对于恒定的替代方案,共享更新遵循获胜的概率减去失败的概率,而不是预期奖励的差异。随着群体规模的增长,伯努利特化会产生错误方向的区域和不消失的更新方差下限。使用现有的估计器控制,在没有组标准差缩放的情况下居中可以保留该模型中的预期返回方向。使用单独的有序序列检查器,详尽的有限和验证了 540 个配置和 3,240 个估计器评估。实施审核使用 256 个脚本部署在固定的、未修改的 TVCache 堆栈中重现共享路径。这些结果并不衡量语言模型训练性能或反驳 TVCache 的确定性输出契约。他们确定,仅边际输出有效性无法证明随机缓存与训练等效。