论文
面向大模型智能体的轮次级多尺度密度比估计
Turn-level Multiscale Density Ratio Estimation for LLM Agents
摘要
大语言模型快速发展,增强后的智能体在复杂任务,尤其多步思考和工具交互中展现潜力。要将模型用于良好设计的智能体范式,需要在多种场景后训练以取得更好表现。PPO、DPO、DIL、GRPO等对齐方法受到欢迎,因为许多研究显示,在保持可接受训练复杂度的同时惩罚负样本能显著改善表现。但多数方法针对简单单轮任务,复杂多轮任务仍有提升空间。我们提出轮次级多尺度密度比估计tlm-DRE,依据多轮任务正负样本空间差距,为相应轮次分配不同权重并进行非对称token级训练。广泛智能体基准实验显示,方法相较传统对齐具有竞争力,并使模型在域内和域外多轮推理任务中表现稳健。
