论文

ALSO:面向社交智能体的对抗式在线策略优化

ALSO: Adversarial Online Strategy Optimization for Social Agents

智能体系统模型训练强化学习Agent 规划Agentic RL

摘要

社会模拟为研究社会智能提供了极具吸引力的试验场,其中智能体在不断演化的情境和策略性适应的对手之下,通过多轮对话进行交互。这类环境本质上是非平稳的,要求智能体随时间动态调整策略。然而,大多数基于大语言模型(LLM)的社交智能体依赖静态人设,而现有增强社会智能的方法(如离线强化学习或外部规划器)并不适合这类场景,它们通常假设平稳性并带来可观的训练开销。为弥合这一差距,我们提出ALSO(对抗式在线策略优化),这是首个面向多智能体社会模拟的在线策略优化框架。ALSO通过两项关键贡献推进社会自适应。(1) ALSO将多轮交互形式化为对抗式老虎机问题,把静态人设与动态策略指令的组合视为臂(arm),在不依赖环境平稳性假设的前提下为非平稳性提供了有原则的解法。(2) 为了在多轮对话中预测奖励并泛化稀疏反馈,ALSO引入轻量神经代理模型从交互历史预测奖励,实现样本高效的探索与持续的在线自适应。在Sotopia基准上的实验表明,ALSO在动态环境中持续优于静态基线与现有优化方法,验证了对抗式在线策略优化对构建鲁棒社交智能体的有效性。

ALSO:面向社交智能体的对抗式在线策略优化:论文配图
图 1:具有角色和自适应策略的代理之间的在线社交互动,其中反馈多轮对话驱动不断变化的行为下的持续策略优化。