论文

Drift-Bench:通过多轮交互诊断LLM智能体在输入故障下的协作失灵

Drift-Bench: Diagnosing Cooperative Breakdowns in LLM Agents under Input Faults via Multi-Turn Interaction

智能体系统Agent任务评测

摘要

随着大语言模型转变为自主智能体,用户输入经常违反协作假设(如隐含意图、缺失参数、错误预设或模糊表达),产生纯文本评测无法捕捉的执行风险。现有基准通常假设指令明确完备,或将评测局限于纯文本、单轮澄清,因而无法测量有真实执行风险下的多轮消歧。我们提出Drift-Bench,首个通过多轮澄清、在面向状态与面向服务两类执行环境中评测输入故障下Agentic语用能力的诊断基准。Drift-Bench以经典通信理论为基础,提供统一的协作失灵分类体系,并采用带Rise评估协议的基于人设的用户模拟器。实验显示,在这些故障下模型性能大幅下降,澄清效果随用户人设与故障类型而变化。Drift-Bench架起了澄清研究与智能体安全评估之间的桥梁,可系统诊断可能导致不安全执行的失败。

Drift-Bench:通过多轮交互诊断LLM智能体在输入故障下的协作失灵
图2:Drift-Bench 流程概览。左——数据扰动:我们从面向状态和面向服务的环境中的已验证任务出发,提取语义框架,并生成受控的输入故障(意图缺陷、参数、前提、表达),以产生可求解且具有诊断信息量的变体。中——智能体-用户交互:由人设驱动的 LLM-as-user 模拟多样的行为,而智能体可在多轮对话中应用结构化的澄清动作,以修复合作性沟通的破裂。右——评估:交互由 Rise 协议进行评分,将澄清行为与下游安全性和任务有效性联系起来。