论文

生成引擎优化的需求方测量:构建和验证百万个角色、意图注释的买家语料库

Demand-Side Measurement for Generative Engine Optimization: Constructing and Validating a Million-Persona, Intent-Annotated Buyer Corpus

模型评测基准与评测资源

摘要

ChatGPT、Gemini 和 Perplexity 等生成引擎直接回答买家问题,并在答案中列出候选品牌名单。研究品牌如何进入或未能进入候选名单需要需求方数据:某个类别的买家询问什么、他们需要什么信息以及他们信任哪些来源。现有的大型角色语料库是为训练数据多样性而构建的,既不带有阶段性搜索意图标签,也不带有首选源字段,因此它们无法加入到供应方推荐测量中。我们构建并验证了 PersonaGen-1M,这是一个包含 1,031,732 个合成买家角色的语料库,涵盖 511 个行业标签和 4 个市场背景,包含 19,416,821 个结构化行为属性,其中 5,160,046 个搜索查询。每个角色都带有一个primary_intent标签,涵盖其查询集(78.3%信息性,17.4%商业性,4.3%事务性)和一个preferred_sources字段,用于命名买家信任的源类型。该语料库是通过 GPU 加速的 MinHash LSH 加上语义去重从四个公共数据集中提取的大约 4000 万个原始角色描述构建而成,然后丰富为固定模式。意图字段选择其查询驱动推荐的商业评估角色,以及针对引文出处数据的preferred_sources字段对;该连接是主要预期用途,其受控经验估计是未来的工作。在 2026 年 8 月调查的百万规模人物语料库中,另一个带有源偏好属性,作为六值媒体渠道枚举; PersonaGen-1M 将按角色命名的源列表与分阶段商业搜索意图标签和附加查询集配对。完整的语料库可根据非商业研究的要求共享;分层子集是公开发布的,因此无需询问我们即可检查和重用协议、模式和验证。