论文
PCTD:用于代理工具检索的偏好引导反事实任务分解
PCTD: Preference-Guided Counterfactual Task Decomposition for Agent Tool Retrieval
摘要
任务分解旨在将模糊指令转化为可执行的原子子任务,从而指导高精度工具检索。然而,我们的分析表明,在基于强化学习的方法中,直接采用工具检索指标(即 Recall 或 NDCG)作为任务分解的奖励很容易导致 奖励作弊。具体来说,模型倾向于通过重复分解等策略来最大化检索匹配。分解结果的浅层特征和检索度量之间的这种虚假相关性会损害涉及看不见的工具的域外 (OOD) 场景中的泛化能力。为了解决这个问题,我们提出了 PCTD,一种偏好引导的反事实任务分解框架。 PCTD 通过反事实奖励量化检索排名分解的边际因果增益,从而从源头切断虚假相关性。同时,它引入了偏好奖励,对逻辑连贯性和原子性进行细粒度的结构监督,鼓励模型生成高质量的分解。此外,我们构建了MTDTool,专门为移动多轮交互设计的任务分解基准。大量实验表明,PCTD 减轻了重复分解,并在检索、分解质量和 OOD 泛化方面超越了 SOTA 方法。