论文

面向大模型智能体的轮次级多尺度密度比估计

Turn-level Multiscale Density Ratio Estimation for LLM Agents

模型训练偏好优化强化学习RLVRAgentic RL

摘要

大语言模型快速发展,增强后的智能体在复杂任务,尤其多步思考和工具交互中展现潜力。要将模型用于良好设计的智能体范式,需要在多种场景后训练以取得更好表现。PPO、DPO、DIL、GRPO等对齐方法受到欢迎,因为许多研究显示,在保持可接受训练复杂度的同时惩罚负样本能显著改善表现。但多数方法针对简单单轮任务,复杂多轮任务仍有提升空间。我们提出轮次级多尺度密度比估计tlm-DRE,依据多轮任务正负样本空间差距,为相应轮次分配不同权重并进行非对称token级训练。广泛智能体基准实验显示,方法相较传统对齐具有竞争力,并使模型在域内和域外多轮推理任务中表现稳健。

面向大模型智能体的轮次级多尺度密度比估计:论文配图
图 1:单次迭代中 tlm-DRE 的整体架构。首先,使用 SFT 策略初始化的代理对轨迹路径进行采样并收集故障轨迹。然后,在这些失败轨迹中,我们识别出低置信度转折点,即模型表现出低自信的转折点。最后,我们使用多尺度密度比估计来训练代理,该估计在优化过程中明确增加了这些已识别的故障轮次的权重。