论文

社会仿真中生成式智能体的步级偏好学习

Step-Level Preference Learning for Generative Agents in Social Simulations

模型训练上下文与知识偏好优化记忆Agent记忆

摘要

基于大语言模型(LLM)的生成式智能体经包含规划、记忆检索、反思与动作选择等中间步骤的长程决策过程仿真人类行为。但这些中间步骤的细粒度人类标注仍稀缺,既有智能体也未落地于人类对此类中间决策的偏好。为弥合该差距,我们引入一个交互式仿真界面——使我们能够收集智能体决策轨迹上的步级人类偏好监督——形成含5.7万细粒度标注的数据集。我们以监督微调与直接偏好优化在该数据上对开放权重语言模型做步级偏好学习:持续改善仿真保真度、协作与交互质量,并诱导更具社会有效性的智能体行为。结果显示:步级人类监督是同时改善局部决策质量与长程智能体行为的有效训练信号。

社会仿真中生成式智能体的步级偏好学习:论文配图
图 1:我们的框架概述。 (1) SimPref 实现分级人工监督。在每个触发的决策步骤中,代理的 LLM 后端根据当前决策上下文生成三个候选输出,并且人工注释者选择首选输出或提供定制的替代方案。这会产生一个接受的输出和多个拒绝的输出,作为成对偏好元组存储在数据集中。 (2) 重复此过程会生成一个 GA 偏好数据集,其中包含 57,239 个偏好对,涵盖 30 个社交事件和 6 个代理模块。 (3) 接受的输出用于监督微调,而成对偏好 (x,y+,y−)(x,y^{+},y^{-}) 用于直接偏好优化。