论文

PersonaForge:代理系统的真实多回合用户模拟

PersonaForge: Realistic Multi-Turn User Simulation for Agentic Systems

模型训练合成数据

摘要

大语言模型 越来越多地用作代理工作流执行器,但现有的训练数据和基准在很大程度上假设信息完整的单轮查询。我们对 16K 现实世界会话的分析表明,75.9% 的交互是多轮的,揭示了用户与代理的交互方式以及此类系统的训练和评估方式之间存在巨大差距。我们引入 \textbf{PersonaForge},一个用于合成真实的多轮用户代理交互的用户模拟框架。 PersonaForge 结合了四维角色空间、根据真实用户统计数据校准的 SOUL 驱动的行为控制以及基于真实种子查询的反向深度构建。使用 PersonaForge,我们构建了一个 6.3K 记录的训练数据集和 \textbf{PersonaForge-Bench},这是一个手动注释的 138 项任务基准,跨越 20 多个专业领域,具有四维评分。 Qwen3.5-27B 上的实验表明,PersonaForge 训练将综合得分提高了 +4.1%,所有四个维度都有所提高,其中任务完成度 (+6.0%) 和响应质量 (+6.8%) 的改善最大。进一步的分析表明,经过 PersonaForge 训练的代理使用更少的回合和工具调用,这表明交互效率得到提高,而消融则证实了 SOUL 组件和自适应模拟的贡献。 PersonaForge 和 PersonaForge-Bench 共同为在真实的多轮用户交互下训练和评估代理奠定了基础。