论文

边际保真度无法在人口综合调查小组中建立用户模拟:响应契约、支持崩溃和调节失败

Marginal Fidelity Does Not Establish User Simulation in Demographic Synthetic Survey Panels: Response Contracts, Support Collapse and Conditioning Failure

模型评测模型能力评测

摘要

人口统计综合调查小组通常通过将汇总答案与已发布的调查相匹配来进行验证。我们测试了来自三个国家四个调查组织的六个多选电池的证书内容。标题分析仅限于三个工具,其合成队列和人类目标共享所述人口框架;其他三个电池仍在敏感性分析中。响应契约主导着测量的保真度。在对齐的工具中,承诺集在最多 500 名受访者的面板中将 128 个模型电池选项槽中的 66 个留空,而在每个选项概率启发下,128 个中的 0 个为空。在八个无上限的模型工具比较中,概率将期权边际 MAE 降低了 4.53 至 7.30 个点。上限仪器在两个模型上反转,直到矢量投影到其规定的最大值。这些是测量效果:人类目标实现了检查所有响应,而向量是潜在的包含倾向。公布的边际协议也无法区分受访者模拟和直接人口估计。在九个对齐的模型电池对上,无角色人口流行率查询的平均 MAE 为 6.27,而承诺面板的 MAE 为 12.39,并赢得了所有九个比较。约束感知概率向量的平均值为 5.34,并且在九个中的四个上击败了查询,因此基线挑战了验证标准,而不是证明直接估计是最佳的。在三个未发表的人口统计单元上,这两种方法都比不上背诵全国分布。因此,总体边际一致性是关于启发契约和无需模拟受访者即可获得的估计的证据,而不是个人模拟的证据。