论文
LLM 能像消费者一样思考吗?使用 ConsumerSimBench 对人群级反应重建进行基准测试
Can LLMs Think Like Consumers? Benchmarking Crowd-Level Reaction Reconstruction with ConsumerSimBench
摘要
LLM 越来越多地被用作“数字消费者”来模拟舆论、预先测试营销决策并预测受众反应。然而,现有的评估很少询问模型是否可以重建真实消费者在公共话语中表现出来的具体反应模式。我们推出 ConsumerSimBench,这是一个由 1,553 个真实的中国社交媒体主题和 23,122 个基本的、经过规则审核的标准构建的基准,涵盖四个反应系列。 ConsumerSimBench 不是用整体偏好法官对开放式世代进行评分,而是将每项任务分解为针对具体反应点的可审计是/否决策,将三名法官的一致性从 65.8% 提高到 92.1%,其中点判断决策与人类多数标签之间的一致性为 98.4%。在 13 个前沿生成器中,最强的模型 Gemini-3.1-Pro 仅覆盖了 47.8% 的真实反应标准,而 GPT-5.2 和 Claude-4.6 尽管在技术基准上表现强劲,但远远落后。这些失败揭示了技术基准性能与基于社会的消费者直觉之间的巨大差距。直接结构化推理提示会降低覆盖率,而生成-反映多代理管道将 MiMo-V2.5-Pro 在子集上的覆盖率从 32.9% 提高到 37.6%。 ConsumerSimBench 将消费者模拟重新定义为对真实公共话语反应的预测问题,表明前沿 LLM 仍远不能可靠地预测消费者在高语境中国消费者话语中实际关心的内容。