论文
经验 grounding 提升LLM智能体模拟中断期间人类行为的真实感
Empirical Grounding Improves the Realism of LLM Agents Simulating Human Behavior During Disruptions
摘要
大语言模型(LLM)智能体为模拟少有或没有直接历史类比条件下的人类行为提供了生成式途径——这是灾害与基础设施中断规划中的常见挑战。但这种生成能力带来效度问题:单个看来合理的智能体推理可能无法重现经验上的人群行为。我们评估经验grounding能否提升LLM智能体模拟在中断期间的统计真实感。具体地,我们开发一个经验grounded的LLM智能体框架:把来自美国社区调查(ACS)的人口统计画像、来自美国时间使用调查(ATUS)的基线日常活动与城市空间上下文嵌入智能体初始化、记忆、决策提示与活动执行。2024年7月费城热浪期间开展的独立家庭调查被保留为外部验证基准。与未grounded的LLM智能体基线相比,grounded模型改进了对正常日常活动的重建:与经验活动剖面的平均相关从0.528提高到0.912,均方误差从0.066降到0.008。热浪条件下,grounded模型更好地复现了调查得到的活动剖面:平均相关从0.349提高到0.836,均方误差从0.098降到0.012。grounded模型捕捉到46.4%的观测热浪响应幅度,未grounded基线仅20.6%。这些发现表明经验grounding能让LLM智能体成为统计上更可信的人群行为模拟器,同时揭示在中断期间人类适应建模上仍存的差距。