论文
信号还是虚假线索?LLM社会推断中调查国家元数据的随机审计
Signal or Spurious Cue? A Randomized Audit of Survey-Country Metadata in LLM Social Inference
摘要
调查国元数据可以提高LLM对个体响应的预测,但相同的线索在随机分配时可能导向错误。一个内部审计测试是否披露随机标签的统一、记录无关的来源是否降低其国家导向的采纳,并且验证过的调查国是否降低了未抽样Brier损失。独立人口锚点和记录的人类答案测量了五个固定API模型、六个国家和七个开发选择的目标方向和后果。在主审查后的72个记录面板中,透明标签和披露随机标签均产生了0.214的国家导向偏差。配对衰减为0.0003(95% CI [-0.0157, 0.0166])。验证过的调查国降低了Brier损失0.040(95% CI [0.024, 0.056]),而随机标签的后悔为零。一个非重叠的混合覆盖一致性面板保留了正面披露随机偏差和验证效用,但衰减仍然不确定。在选定的目标上,验证过的元数据在两个面板中都有效,但披露并未可靠地减少随机标签的采纳。PROV-FORECAST包含14,400个配对的项级概率分布,从校准后的面板中获得。
