论文
Drift-Bench:通过多轮交互诊断LLM智能体在输入故障下的协作失灵
Drift-Bench: Diagnosing Cooperative Breakdowns in LLM Agents under Input Faults via Multi-Turn Interaction
摘要
随着大语言模型转变为自主智能体,用户输入经常违反协作假设(如隐含意图、缺失参数、错误预设或模糊表达),产生纯文本评测无法捕捉的执行风险。现有基准通常假设指令明确完备,或将评测局限于纯文本、单轮澄清,因而无法测量有真实执行风险下的多轮消歧。我们提出Drift-Bench,首个通过多轮澄清、在面向状态与面向服务两类执行环境中评测输入故障下Agentic语用能力的诊断基准。Drift-Bench以经典通信理论为基础,提供统一的协作失灵分类体系,并采用带Rise评估协议的基于人设的用户模拟器。实验显示,在这些故障下模型性能大幅下降,澄清效果随用户人设与故障类型而变化。Drift-Bench架起了澄清研究与智能体安全评估之间的桥梁,可系统诊断可能导致不安全执行的失败。
