论文

当合理性不现实时:在基于 LLM 的城市模拟中评估人员流动性

When Plausible Is Not Realistic: Evaluating Human Mobility in LLM-Based Urban Simulation

模型评测评测方法与指标

摘要

基于 LLM 的生成代理越来越多地用于城市模拟器,但仍不清楚它们是否再现了经验上现实的人类流动模式或仅仅生成了合理的流动叙述。我们引入了一个验证框架,用于根据现实世界的移动数据评估基于 LLM 的城市模拟器的生成代理的移动性。为此,我们使用移动法则、时间节律、网络主题、语义活动转换和行为移动配置文件。使用来自大巴黎地区和上海的数据集,我们从移动现实主义的多个维度评估了 AgentSociety 和 CitySim。我们的分析揭示了叙事合理性与经验流动性现实主义之间存在巨大差距。尽管模拟器捕获了一些高级语义活动分布,但它们很难重现核心空间和时间约束,包括现实的行程长度分布、起点-目的地流、停留时间和转换动态。我们进一步观察到,实际的移动多样性在默认提示配置中是不稳定的,并且可能需要显式的配置文件感知初始化。为了支持可重复的评估,我们还提供可扩展且开放的 LLM 驱动的基础设施,用于区域比例地图生成、可观测性增强模拟、移动性度量计算和交通模拟。我们的研究结果强调需要对基于 LLM 的城市模拟器进行严格的实证验证,并为构建更现实和可重复的城市模拟系统提供实用工具。