论文
超越平均值:根据小型试点数据调整基于 LLM 的测量模拟器的三轴保真度
Beyond the Mean: Three-Axis Fidelity for Aligning LLM-Based Survey Simulators from Small Pilot Data
摘要
大语言模型 (LLM) 越来越多地用于模拟社会调查响应,但其输出表现出系统偏差:边际分布倾斜、响应方差校准不佳以及预测结果关系减弱。我们提出一个简单的问题:给定人类反应的小试点样本,LLM 能否恢复更广泛人群的统计特征?我们沿着三个轴分解恢复:结构保真度、边际保真度和个体保真度。我们以 COVID-19 错误信息调查作为案例研究,对三种方法进行了基准测试:提示、纠正和 微调。研究结果表明,小试点样本上的 微调 提供了一种实现多种形式保真度的平衡方法,但这种保真度水平可能因子样本而异,可能会威胁到多元对齐。