论文
智能体为何过度信任环境证据:可扩展的证据核验缺陷评测框架
When Agents Overtrust Environmental Evidence: An Extensible Agentic Framework for Benchmarking Evidence-Grounding Defects in LLM Agents
摘要
大语言模型代理越来越多地通过面向环境的支架进行操作,这些支架公开文件、网页、API 和日志。这些观察结果会影响工具的使用、状态跟踪和动作排序,但它们的可靠性和权威性往往是不确定的。因此,环境证据核验是一个系统级问题,涉及上下文接纳、证据来源、新鲜度检查、验证策略、动作门控和模型推理。现有的代理基准测试主要评估任务能力或特定攻击,例如即时注入和内存中毒,但它们没有明确说明一个基本的可靠性问题:当观察结果陈旧、不正确或恶意时,代理是否仍保持在真实的环境状态中。我们引入了 EnvTrustBench,这是一个用于对这种故障模式进行基准测试的代理框架。我们将证据基础缺陷(EGD)定义为一种行为失败,其中代理将面向环境的声明视为采取行动的充分证据,而不根据现有的现有证据来解决它,从而导致在真实环境状态下出现任务不正确的错误路径。给定一个任务场景,EnvTrustBench 生成工作空间、环境、面向代理的目标和验证预言机,执行评估的代理,记录其动作观察轨迹和最终状态,并应用预言机来生成判决。使用 6 个 LLM 主干和 5 个广泛使用的支架,我们评估了 11 个任务场景中生成的 55 个案例,每个场景通过五次反馈引导的生成迭代进行了扩展。结果表明,EGD 在整个操作工作流程中不断出现,突出表明环境证据核验是一个核心代理可靠性问题,具有重要的安全影响。