论文

IACM-RL:动态意图波动下复杂工具调用的意图感知上下文管理和强化学习

IACM-RL: Intent-Aware Context Management and Reinforcement Learning for Complex Tool Invocation under Dynamic Intent Fluctuations

上下文与知识上下文工程

摘要

在现实环境中执行长期工具调用受到动态用户意图噪声的严重挑战。现有方法试图通过隐式历史扫描或文本压缩来实现鲁棒性,但主要假设简单场景中的完美指令。在波动的环境下,过时的约束不可避免地会稀释模型注意力,引发灾难性的意图偏差和无限的 API 循环。为了解决这个问题,我们提出了 IACM-RL,一个用于稳健工具调用的综合框架。首先,我们介绍 DynamicIntent 管道,综合 13 个细粒度波动场景的轨迹,并搭配五维诊断指标套件。其次,IACM-RL 部署基于信念状态的自生成上下文管理器,主动跟踪不断变化的目标并使用结构过时标志隔离被覆盖的参数。为了自动内化这种状态跟踪能力,我们使用分层意图驱动奖励以及三个辅助损失(动作校准、CM 提取和状态 蒸馏)来优化策略。 DynamicIntent、BFCL-V3 和 $\mathrmτ^2$-Bench 上的实验表明,IACM-RL 的性能显着优于基线,减少了无限循环和陈旧上下文错误,同时增强了域外泛化能力。