论文
KITE:通过稀疏旗舰校准扩展 JEV 群体实验
KITE: Scaling Jev Population Experiments with Sparse Flagship Calibration
摘要
KITE 对每个唯一状态查询一次类型化行为内核,然后使用事件键控随机性和通用随机数执行表中任意大小的群体。昂贵的旗舰模型是为估计干预效果的稀疏配对锚保留的。测量到的人类模型差异作为共享误差传播到每个结论中。因此,群体实验成本随着独特的状态和锚定而变化,而不确定性则由有关人的证据而不是蒙特卡罗噪声决定。在 Epstein 对 9,070 名参与者进行的实验中,覆盖 1.7% 州的锚点将效果误差降低了 41%(绝对 MAE 降低了 0.0125)。在 37 个 SocSci210 实验中,0.5-1.5% 的锚点覆盖率将捕获的决策增益从 0.27 提高到 0.39。该内核在 16 个国家/地区的研究中的所有 15 个新国家/地区均通过了内容保真度标准。共享差异在名义 80% 和 90% 的情况下产生的回顾性覆盖率分别为 93% 和 96%,而单独的人类抽样不确定性则为 29% 和 36%。 100 万代理在笔记本电脑上在 0.9 秒内执行了 20 个表格步骤。该架构提供了一种在人体试验、多国内容审计和不确定性感知政策比较之前筛选候选干预措施的途径,但代价是使用稀疏旗舰锚点进行数千次内核调用。特定于财产的证据记录将每次使用与其验证范围、纠正来源和不确定性联系起来,使这些应用程序可审计。