论文
走向真实世界的人类行为模拟:在长视野、跨场景、异构行为轨迹上对 大语言模型 进行基准测试
Towards Real-world Human Behavior Simulation: Benchmarking Large Language Models on Long-horizon, Cross-scenario, Heterogeneous Behavior Traces
摘要
大语言模型 (LLM) 的出现揭示了通用用户模拟器的潜力。然而,现有的基准仍然局限于孤立的场景、狭窄的行动空间或合成数据,无法捕捉真实人类行为的整体本质。为了弥补这一差距,我们引入了 OmniBehavior,这是第一个完全根据现实世界数据构建的用户模拟基准,将长期、跨场景和异构行为模式集成到一个统一的框架中。基于这个基准,我们首先提供经验证据,证明以前具有孤立场景的数据集受到狭隘视野的影响,而现实世界的决策依赖于长期的、跨场景的因果链。对最先进的 LLM 的广泛评估表明,当前的模型很难准确地模拟这些复杂的行为,即使上下文窗口扩展,性能也趋于稳定。至关重要的是,模拟行为和真实行为之间的系统比较揭示了一个基本的结构偏差:LLM 倾向于趋向于积极的普通人,表现出过度活跃、角色同质化和乌托邦偏见。这导致个体差异和长尾行为的丧失,突出了未来高保真模拟研究的关键方向。