论文
经跨调查迁移的硅基采样
Silicon Sampling via Cross-Survey Transfer
摘要
硅基采样——用大语言模型(LLM)模拟人类调查受访者——已成为增强传统调查研究的有前景方法。但多数评估依赖分布比较而非个体级预测——有将模式匹配与一致的受访者级预测混为一谈的风险。我们提出跨调查迁移——更严格的评估框架:给LLM某受访者对一组问题的回答——要求其预测同一调查中完全不同问题的回答。使用台湾选举与民主化调查(TEDS)2024数据、三个开放权重LLM(27B-120B参数)与监督机器学习基线——我们发现:(1) 零样本LLM在真正未见题目上达52%准确率——与在同群体数据上训练的监督随机森林差距缩小到6个百分点以内;(2) 涌现稳定的构念可预测性层级——从党派态度的67%到主权议题的23%;(3) 方差坍缩与安全对齐效应——两个常被引用的LLM局限——结果比此前报告更微妙:方差坍缩同样影响监督模型——而对齐效应跨模型家族差异剧烈。这些发现厘清了硅基采样的前景与边界。