论文

超越合作型模拟器:生成真实用户画像以鲁棒评估LLM智能体

Beyond Cooperative Simulators: Generating Realistic User Personas for Robust Evaluation of LLM Agents

智能体系统Agent任务评测

摘要

大语言模型(LLM)智能体正被越来越多地部署在要与形形色色的人交互的场景中,其中包括表述不清、缺乏耐心或不愿分享信息的用户。然而,大规模收集真实交互数据仍然代价高昂。该领域已转向基于LLM的用户模拟器作为替身,但这些模拟器继承了其底层模型的行为特征:合作且同质化。因此,在模拟中表现强劲的智能体,在真实用户未见过的多样化沟通模式下往往失效。为缩小这一差距,我们提出Persona Policies(PPol),一个即插即用的控制层,能在用户模拟器中诱导真实的行为差异,同时保留原有任务目标。我们不采用手工打造画像的方式,而是将画像生成表述为LLM驱动的进化程序搜索,优化一个Python生成器来发现行为并将其转化为保留任务目标的角色扮演策略。候选生成器由一个多目标适应度分数引导,该分数将类人程度与对人类行为模式的广泛覆盖相结合。优化完成后,该生成器可为该领域中的任意任务产生多样的类人画像种群。在tau^2-bench的零售和航空领域,进化得到的PPol程序在适应度分数上较基线模拟器带来33-62%的绝对提升。在一项盲评中,标注者将PPol条件化的用户判定为人类的比例达80.4%,接近真实人类轨迹,且几乎是基线模拟器的两倍。用PPol训练的智能体对具有挑战性的分布外行为更鲁棒,相较于仅在现有模拟交互上训练,任务成功率提升+17%。这提供了一种在不改变任务或奖励的情况下强化基于模拟器的评估与训练的新途径。

超越合作型模拟器:生成真实用户画像以鲁棒评估LLM智能体:论文配图
图 1:角色策略 (PPol) 程序演进循环概述。给定一项任务,程序 GG 会生成 NN 角色策略,这些策略在模拟用户的通信方式上有所不同。候选程序通过任务推出来评估人类相似性和行为覆盖范围,而反思反馈则判断轨迹的质量,以指导轴、采样规则和提示的细化。一旦优化,生成器就可以为该领域的新任务生成不同的角色策略。