谁被命名:引文类型通过扎根语言模型预测个人命名,名册工具捕获其中的 0.5%
Who Gets Named: Citation Type Predicts Individual Naming by Grounded Language Models, and a Roster Instrument Captures 0.5% of It
摘要
之前关于人工智能品牌知名度的工作衡量了公司:模型是否推荐一家公司,并跟踪其声誉。这项研究在买家选择人员的类别中向下一级提出了这个问题。截至 2026 年 7 月 24 日,它在两个小时内发出了 2,400 个有来源依据的API调用:120 个买家意图提示、四种模型(GPT-5.6 Sol、Gemini 3.6 Flash、Perplexity Sonar Pro、Grok 4.5)、每种模型五次迭代、四个欧洲市场和五种查询语言。每个响应都根据是否指定了某个专业人士的名字进行编码,通过规则级联进行编码,该规则级联从不查阅名册,并且会丢弃解析到同名美国城市的检测(精确度 96.9%,召回率 61.7%,因此下面的每个比率都是下限)。所有推理均针对提示内的聚类进行校正:类内相关性为 0.258,有效 n 为 407,而名义相关性为 2,400。 25.8% 的回复中模型提到了某个人的名字。类别占主导地位:房地产占 35.4%,汽车经销占 32.9%,保险占 9.1%(卡方 159.3,修正后 p = 5.8e-8)。模型差异四倍,从 Grok 38.0% 到 Gemini 9.3%。引文类型可以预测命名,而引文量则不能:命名响应引用个人自己网站的频率高出 2.6 分(95% CI +1.4 至 +3.9),类别门户网站的引用频率高出 4.3 分,并且以相同的比率引用公司拥有的页面(44.1% 对 45.5%)。在九个匹配的翻译对中,英语提示在 36.7% 的回答中提到了某个人,而对于同一问题,用本地语言回答的比例为 15.6%(OR 3.14,聚类 p = 0.074,因此方向很明确,设计无法关闭它)。根据 LinkedIn 公共搜索建立的 939 人名册与 27,293 个名字形状提及中的 128 人匹配(0.47%),939 人中的 26 人曾经被命名,而从名册得出的 0.0% 到 25.4% 的比率衡量了这种重叠。基于名册的个人人工智能可见性测量只看到了模型所做的一小部分且不具有代表性。