论文

营销研究中的合成数据:如何评估以及何时可信赖

Synthetic Data in Marketing Research: How to Evaluate and When to Trust

模型评测评测方法与指标

摘要

关于合成数据在营销研究中的争论,存在两种极端观点:一是大语言模型(LLM)使人类受访者过时,二是应完全避免使用。我们主张,更关键的问题并非合成受访者是否有效,而是何时有效。基于Brand、Israeli和Ngwe(2026)的研究,我们做出三项贡献。首先,我们区分了三种类型的合成数据(无依据的LLM响应、分群级人物设定和个体级数字孪生),并将其对应到可支持的决策类型。其次,我们提出四类准确度测量的分类体系,指出现有文献中数字孪生准确率从近乎完美到接近偶然水平的差异,主要源于测量内容不同,而非方法问题;即使输入信息极少,聚合指标仍可能表现良好,且可能掩盖个体层面的区分缺失。第三,我们提出“被遗忘问题”问题,即在实际调研中某问题被遗漏,可作为数字孪生增强已有数据的场景。我们提出一种事前可回答性诊断方法,无需真实答案:即用构建数字孪生所用的数据作为输入,由随机森林预测孪生输出的R²值。在一项包含108个态度问题的全国代表性调查(N=3,063)中,当R²高于0.7时,数字孪生与人类个体层面的相关性平均提升15%,且回答不佳的问题比例从25.9%降至4.3%。嵌入相似性与有经验研究人员的判断提供了相关但较弱的补充筛选。