论文
基于多样性引导用户模拟的高效智能体评估
Efficient Agent Evaluation via Diversity-Guided User Simulation
摘要
大语言模型(LLM)越来越多地被部署为面向客户的智能体,但由于其随机性的多轮交互,评估其可靠性仍然充满挑战。当前的评估协议依赖对完整智能体-用户对话的线性蒙特卡洛rollout来估计成功率。然而,这种方法计算效率低下,会反复重新生成相同的早期前缀,且常常无法发现由罕见用户行为引发的深层失败模式。我们提出DIVERT(Diversity-Induced Evaluation via Branching of Trajectories),一个高效的、基于快照的、覆盖度引导的用户模拟框架,用于系统性地探索智能体-用户交互。DIVERT在关键决策点捕获完整的智能体-环境状态,并从这些快照恢复执行,从而复用共享的对话前缀并减少冗余计算。在每个分叉点,该框架使用有针对性的、诱导多样性的用户回应进行分支,实现对替代交互路径的定向探索。通过将评估聚焦于语义多样且未被充分探索的轨迹,DIVERT同时提升了效率与覆盖度。实证结果表明,与标准的线性rollout协议相比,它能发现更多每token的失败,同时扩展了识别出失败的任务集合。
