论文
无双关语意图:以人为中心的 LLM 评估的合理未知名称
No PUN Intended: Plausible Unknown Names for Person-Centred LLM Evaluation
摘要
人名被广泛用作 LLM 对事实性、隐私泄露、偏见和弃权的评估中的提示变量,但当姓名的证据状态不受控制时,测量可能会混淆记忆、检索、姓名先验和错误的人归属。我们将未知名称操作为具有似是而非的名字倒数形式,没有索引全名证据,并且在记录的验证运行下没有歧义信号,并引入了 PUN(合理的未知名称),这是一种用于构建和验证此类名称的协议,结合了源自维基数据的组件、支持网络的 LLM 筛选和受控搜索重新验证。我们报告了接受率、可重复性、消融和一项 204 名参与者的人体研究,发现接受的名字比对照组更相似,而参与者仅在 3% 的案例中恢复了个人证据。我们发布了 300 个带有比较对照的名称。