论文

合成人设能否预测真实受众反应:一项无 Persona 基线胜过 Persona 文案模拟的 Sim-to-Real 研究

Do Synthetic Personas Predict Real Audience Response? A Sim-to-Real Study Where a No-Persona Baseline Beats Persona-Based Copy Simulation

模型评测鲁棒性、公平性与可信度评测

摘要

营销人员越来越多地使用大语言模型(LLM)作为合成人设(synthetic personas),在文案发布前预测受众反应,其依据是有证据表明以画像为条件的 LLM 能模仿人类样本。但这种预测对真实行为是否真的有效——Persona 机制是否真有帮助?我们开展一项模拟到真实(sim-to-real)的效度研究,以 Upworthy Research Archive(在共享真实流量上进行的数千次标题 A/B 测试,带有实测点击率)作为留出的真值。我们将基于真实受众人口统计构建的十人设面板,与一个直接询问模型典型读者点击可能性大小的无 Persona 零样本基线进行比较。有两个发现突出。第一,真值的可靠性是硬约束:大多数 A/B 测试没有统计上可区分的赢家,因此效度只能在可靠子集(n=399)上测量。第二,与 Persona 模拟的前提相反,Persona 条件化降低了预测效度:无 Persona 基线对变体的排序明显更好(Kendall τ=0.361,中等效应;top-1 准确率 49.2%),而 Persona 面板仅为 τ=0.084、top-1 34.6%,两者置信区间不重叠。直接询问模型调用的是准确的人群层面先验;强迫模型扮演特定 Persona 则注入了偏差与噪声。该结果在三个独立的 Upworthy 数据划分上复现,在另一领域的新闻数据集上方向一致,并对随机种子、提示措辞和模型选择保持稳健——横跨三个 Gemini 档位与另一模型家族(OpenAI gpt-4.1,配对差异显著)。结论:在预测总体互动时,一个普通的 LLM 排序器胜过 Persona 模拟——合成人设不仅是弱预测器,而且比不用更糟。所有数字均可由公开的、以产物为先的复现包重新生成。

合成人设能否预测真实受众反应:一项无 Persona 基线胜过 Persona 文案模拟的 Sim-to-Real 研究:论文配图
图 2:符合条件的各 A/B 测试中“头名与次名 CTR 差异”的单侧 p 值分布。只有位于虚线截止值左侧的测试才具有统计上可靠的胜出者;其余测试在构造上即不可预测。