论文

基于多样性引导用户模拟的高效智能体评估

Efficient Agent Evaluation via Diversity-Guided User Simulation

智能体系统Agent任务评测

摘要

大语言模型(LLM)越来越多地被部署为面向客户的智能体,但由于其随机性的多轮交互,评估其可靠性仍然充满挑战。当前的评估协议依赖对完整智能体-用户对话的线性蒙特卡洛rollout来估计成功率。然而,这种方法计算效率低下,会反复重新生成相同的早期前缀,且常常无法发现由罕见用户行为引发的深层失败模式。我们提出DIVERT(Diversity-Induced Evaluation via Branching of Trajectories),一个高效的、基于快照的、覆盖度引导的用户模拟框架,用于系统性地探索智能体-用户交互。DIVERT在关键决策点捕获完整的智能体-环境状态,并从这些快照恢复执行,从而复用共享的对话前缀并减少冗余计算。在每个分叉点,该框架使用有针对性的、诱导多样性的用户回应进行分支,实现对替代交互路径的定向探索。通过将评估聚焦于语义多样且未被充分探索的轨迹,DIVERT同时提升了效率与覆盖度。实证结果表明,与标准的线性rollout协议相比,它能发现更多每token的失败,同时扩展了识别出失败的任务集合。

基于多样性引导用户模拟的高效智能体评估:论文配图
图 1:标准推出评估与 DIVERT。左图:传统的评估从一开始就反复展开完整的对话,通常会产生低影响力的交互,并且无法探索更深层次的故障模式。右图:我们基于快照的评估框架在关键连接点存储中间对话状态和分支,并提供定向、多样化的用户响应,从而实现更有效的探索和改进的故障发现(附录 A 中提供了完整的示例)。