论文

NAQD Env:语言Agent选择性退出的基准

NAQD Env: A benchmark for selective withdrawal in language agents

智能体系统Agent任务评测

摘要

当证据发生变化、许可被撤销或停止指令到达时,语言Agent必须修改计划的行动。有用的响应是有选择性的:暂停受影响的操作,保留不受影响的工作,并仅在充分修复后恢复。我们引入了 NAQD-Env,这是一个综合环境,它根据明确的证据、授权和约束依赖性的确定性参考策略来评估这些决策。十一个依赖家庭支持对发展结构、保留家庭和保留结构组合的评估。指标区分尝试性违规和模拟执行门允许的违规,并联合报告策略协议、任务价值、撤回、恢复和事件报告。我们在 350 个冻结场景的三种提示条件下评估了来自两个家庭的三个开放权重指令调整模型,在门重放之前产生了 3,150 个模型提示片段。在报告的条件下,撤回召回率最多为 0.06,在符合条件的机会中没有观察到有效的恢复,并且只有一个事件与完整的参考策略相匹配。在 NAQD 提示下,Qwen2.5-7B 的不安全尝试事件比 Qwen2.5-3B 和 Llama-3.1-8B 少,但完成的有用工作也较少,并且不太准确地保留未受影响的操作。探索性监督微调探针将 Qwen2.5-3B 决策精度从 0.45-0.54 提高到 0.83-0.92;单独的诊断揭示了课程遗漏和事件报告丢失后的不当退学。这些结果促使将选择性退出作为Agent可靠性的一个独特组成部分进行评估。该设置使用可信的结构化输入来衡量策略应用,并且不建立现实世界的遏制或源验证能力。