论文

基于邻近度的多轮优化:LLM智能体训练的实用贡献归因

Proximity-Based Multi-Turn Optimization: Practical Credit Assignment for LLM Agent Training

模型训练强化学习RLVRAgentic RL

摘要

多轮LLM智能体正成为生产系统的关键,覆盖客服自动化、电商助手与交互式任务管理等场景;在这些场景中,准确区分高价值信息信号与随机噪声对样本高效训练至关重要。在真实场景中,简单任务上的失败可能只是随机波动,而高难任务上的成功才代表真正能力突破。然而现有群组策略优化方法僵化依赖离散批次内的统计偏差,任务难度波动时常错配信用。为此,我们提出基于邻近度的多轮优化(ProxMO),一个为真实部署约束量身打造、实用的稳健框架。ProxMO以两个轻量机制融入全局语境:成功率感知调制按回合级难度动态调整梯度强度,基于邻近度的软聚合在步骤级通过连续语义加权求取基线。在ALFWorld与WebShop基准上的大量评估表明,ProxMO以可忽略的计算成本取得对现有基线的大幅性能提升。消融研究进一步验证了两种机制各自及协同的有效性。关键是,ProxMO与标准GRPO框架即插即用兼容,便于在既有工业训练管线中即时、低摩擦地采用。实现见 https://anonymous.4open.science/r/proxmo。

基于邻近度的多轮优化:LLM智能体训练的实用信用分配
图2:ProxMO概览。回合级(Episode-level):成功率感知的调制使信用分配适应任务难度(即p)。步骤级(Step-level):基于邻近度的软聚合消除离散边界,实现稳健的基线估计。