论文

SWORD:联合优化用户行为仿真的工作流与提示

Joint Workflow and Prompt Optimization for User Behavior Simulation

智能体系统Agent 协作

摘要

用户行为模拟是通过使用模拟的智能体代替真实用户,对信息系统内的用户交互进行计算建模。它支持系统测试和评估、决策和预测以及用户体验设计。现有的模拟器依赖于手工制定的规则或领域专业知识,这些规则或领域的专业知识在任务之间的迁移效果很差。 SWORD(Simulation-driven Workflow and Prompt Optimization with Role-based Design)被引入作为联合优化多智能体工作流拓扑和自然语言提示的框架。它仅由标量任务指标引导,没有域初始化或特定于任务的工程。实验结果表明,在受控、相同的 骨干模型 比较下,SWORD 比仅提示、仅工作流程和分阶段优化基线取得了统计上显着的收益。相对于最强的已发布的特定领域基线,SWORD 进一步提高了准确性,同时使用更小的 骨干模型 模型、大幅减少的训练数据以及非常合理的 API 成本(每个数据集为 \$4--\$6)。除了预测性能之外,SWORD 纯粹从标量错误反馈中自主发现领域相关信号、评论情绪映射规则和流行病学衰退先验,将文本梯度建立为用户行为建模中无监督特征重要性发现的机制。

SWORD:联合优化用户行为仿真的工作流与提示:论文原图
图 1. 基于 LLM 的用户模拟范例和 SWORD 框架的比较。 (A) 智能体-per-User:实例化每个用户隔离的 LLM 智能体,保留个性化但不共享知识。 (B) 代码生成:通过共享的智能体工作流程为每个用户生成可执行的 Python 模拟代码,实现个性化,同时将工作流程设计和模拟逻辑验证的负担转移给领域专家,限制任务的可转移性。 (C) SWORD(我们的):与代码生成相比,又向前迈出了一步,通过自动化工作流程、提示优化和任务无关的模块化智能体池设计,消除了对不同用户模拟任务的领域专家的依赖。比较用户行为模拟范例的三面板图。面板 A 显示了带有隔离 LLM 智能体的智能体-per-User 范例。面板 B 显示了代码生成范例,其中 LLM 生成共享 Python 执行函数。面板 C 显示了 SWORD 范式,其特征是通过工作流演化和提示优化的交错共同演化循环进行优化的共享工作流 DAG(分析器、规划器、生成器、评论家、合成器)。