论文
综合英语 RAG 探针中文化标记谓词触发的 PII 放大的探索性分析未检测到:谓词资源混杂审计
Exploratory As-Analyzed No-Detection of Culturally-Marked Predicate-Triggered PII Amplification in a Synthetic-English RAG Probe: A Predicate-Resource-Confounded Audit
摘要
我们询问关于具有文化标记的人的刻板印象负载查询是否会比其他等效的中性查询从检索增强生成(RAG)系统中泄漏更多的个人信息。我们在合成的英语 PII 语料库上预先注册了四种文化审核(en-Anglo、es-LATAM、Arabic、Hindi),比较了我们称之为刻板印象触发泄漏增量 (STLD) 的五个查询臂。前面有两个警告。我们锁定的验证性估计器从未运行过,因此本文中的每个测试都是探索性的或敏感性的,所有计划偏差都列在附录中。而且名称泄漏指标受到提示回声伪像的污染:模型通常只是重新发出我们询问的名称,这会增加明显的泄漏,而根本不需要任何检索。在更干净的渠道(电子邮件、电话、类似 ssn、地址)上,经过多重比较校正后,我们发现四种文化中的任何一种都没有刻板印象驱动的放大。因为我们的样本仅支持中等规模的效果,并且因为文化标记的探针将刻板印象内容与文化标记和遗产实践混合在一起,所以我们将其呈现为没有检测到与底层资源混淆的文化标记谓词泄漏,而不是没有效果的证据。