论文

HiDiffTIR:多轮工具集成推理的分层难度感知策略优化

HiDiffTIR: Hierarchical Difficulty-Aware Policy Optimization for Multi-Turn Tool-Integrated Reasoning

模型训练强化学习Agentic RL

摘要

工具集成推理(TIR)是 LLM 代理通过与外部工具迭代交互来解决复杂任务的基本能力。强化学习 (RL) 已成为实现此功能的主导范例。然而,现有的方法通常分配统一的轨迹级优势,并平等地对待所有正确的工具调用,忽略了轨迹和推理步骤之间不同的难度和学习价值。这可能会导致学习信号不精确,无法充分区分琐碎和具有挑战性的工具使用模式。为了解决这个限制,我们提出了 HiDiffTIR,一种用于多轮 TIR 的分层难度感知策略优化框架。 HiDiffTIR 在轨迹和轮次级别执行难度感知信用分配,使策略能够专注于信息更丰富的轨迹和更难的推理步骤。值得注意的是,这种细粒度的优化是在没有额外监督的情况下实现的,仅依赖于标准 RL 采样轨迹所得出的组级统计数据。对三个工具使用基准的广泛实验表明,HiDiffTIR 在强大的 RL 基线上持续提高了多轮 TIR 性能和工具调用准确性,强调了在工具集成的 LLM 代理中进行难度感知信用分配以实现有效策略优化的必要性。