论文

衡量长程人类活动模拟的行为保真度

Measuring the Behavioral Fidelity of Long-Horizon Human Activity Simulations

模型评测智能体系统Agent任务评测评测方法与指标长程任务评测

摘要

随着基于LLM的人体模拟器越来越多地用于政策、评估和训练,它们必须忠实地再现真实的行为模式。虽然之前的工作已经检验了调查回答和对话中的行为保真度,但更长期的现实世界活动在很大程度上仍未得到探索。我们引入了一个框架,用于评估跨时间粒度和分析级别的长期活动模拟中的行为保真度。作为案例研究,我们收集了野外办公活动的 43 小时多摄像头数据集,并比较了跟踪衍生调节机制:角色描述符、少样本样本以及统计转换和当​​天时间先验。我们发现,不同指标的行为保真度并不统一:统计先验使活动和序列分布最接近真实行为,但过于碎片化的惯例并抑制了人体内的变异性。这些发现激发了更全面的评估,涵盖多个指标、时间粒度和分析级别。

衡量长程人类活动模拟的行为保真度:论文配图
图1:数据收集期间使用的相机位置。