论文

历史记录误导时:评估并改善多轮上下文中的工具使用

When History Lies: Evaluating and Improving Tool Use under Misleading Multi-Turn Histories

智能体系统上下文与知识上下文工程Agent 工具调用

摘要

工具调用代理通过累积对话和工具痕迹来推断任务状态。然而,在持续交互中,历史痕迹在停止对当前请求有效后仍可能保持结构上有效且语义上合理。我们展示了这种历史可以劫持模型已有的策略:在Qwen3-1.7B上,污染翻转了32.1%的决策,频繁诱导使用了被污染的实体或接口规范。我们引入bench作为同步的原始、污染和oracle状态视图,保留了系统的政策、当前工具、最新的请求以及金标准下一个动作。十一个金标准保持干预隔离了在完整调用和非调用决策中的失败点。进一步,我们提出了ours,通过软监督从学生生成的前缀中转移一个被污染的历史条件教师策略到观察者的学生上。在Qwen3-1.7B上,ours达到了平衡工具使用准确率87.0%,超越了Gold-SFT(66.3%)、Oracle序列蒸馏(82.3%)和离线政策词元蒸馏(85.0%)。该方法表现出一致性:一个8B教师将1.7B紧凑的学生提升到91.9%,而一个8B学生则达到93.0%。结果进一步展示了清洁历史、未见功能、独立生成的评估上下文以及外部工具使用基准的转移,同时处理了噪音多跳问题问答。这些结果表明历史可靠性是一个显著的工具使用瓶颈,并展示了可靠状态策略迁移作为有效且可扩展的解决方案。