论文

训练与部署一致:生产编码Agent的Token级后训练

Train What You Deploy:Token-Faithful Post-Training of a Production Coding

模型训练强化学习Agentic RL

摘要

现有的编码与终端智能体后训练流程存在严重的Token和控制保真度错误:简化训练环境与实际部署不匹配,且从智能体日志中离线重建Token会扭曲原始提示,并将策略调用与模型后台操作混淆。我们提出了一种保真度感知的训练耦合框架,保留训练端对原始提示的采样,通过协商训练协议消除虚假模型调用,并将损失计算限制在可验证的Token跨度上,提供失败时默认拒绝的保证。我们进一步提出可认证散度近端策略优化(C-DPPO),在标准DPPO基础上建立紧致的双边TV认证边界、自适应K规则、预算感知的序列保证以及抗误差的策略掩码。在匹配的Baize5B和Baize10B模型上,使用相同的训练与测试协议在TMax-100基准上评估,C-DPPO在各模型规模下均实现比标准DPPO稳定的+3.0个点性能提升。证书审计验证了我们认证训练流程的可靠性及全量运行覆盖性。