论文

当工具无声地撒谎时:评估和减轻工具增强数据Agent中的盲目合规性

When Tools Silently Lie: Evaluating and Mitigating Blind Compliance in Tool-Augmented Data Agents

模型评测鲁棒性、公平性与可信度评测

摘要

工具增强数据Agent依赖于工具输出来进行分析决策。然而,成功的执行可能会返回看似合理但不正确的证据,要求Agent决定是否信任或验证它。理解这一失败需要检查通过检查获得的证据和最终采用的答案。我们引入 ToxicBench 来衡量数字、标签、模式和检索错误下的检查和采用,将固定源数据的干净观察和有毒观察配对。在跨三个适配器的 118 项任务 GPT 评估中,中毒使任务成功率降低了 26 到 39 个百分点。普通重试有助于一次性中毒,而重复中毒则在检查后发现错误答案采用。对三个公共表的控制隔离了所提供的证据如何影响恢复。冻结评分器后,我们将其判断与人类对 200 个轨迹的注释进行比较,发现任务成功率达到 96%。人类判断支持重试超过 Base 的收益,并在检查审计任务后确认采用。我们发布轨迹、版本化评分以及参考和交付审核。这些发现强调了证据可用性和答案选择是Agent可靠性的补充维度。