论文

数值对了,地区错了?评测LLM的政策知识混淆

Right Number, Wrong State? Measuring Cross-Jurisdiction Substitution in LLM Recall of State Policy

模型评测应用与实践评测方法与指标鲁棒性、公平性与可信度评测行业应用

摘要

当LLM错误地回答了特定于州的政策问题时,它可能是产生幻觉,或者可能返回在另一个州有效的真实值。我们使用最小集设计对此进行测试:问题措辞是固定的,只有管辖区有所不同,涵盖美国 50 个州和哥伦比亚特区(51 个管辖区)以及三个明确定义的医疗补助收入资格数量。黄金值来自官方数据手册,并与 102 个检查单元中的 101 个独立来源一致。根据预先注册的协议,Claude Sonnet 5.5 和 GPT-5.6 Sol 可重复地给出另一个状态的当前值,对于 153 个项目中的 10 个和 25 个项目,在两次独立重复中相同。然而,归因是脆弱的。与检查被询问州自己的记录中的每个数字相比,相信任何等于另一个州的值的错误答案会产生3-5倍的可重复替换,因为许多明显的跨州答案是被询问州自己根据另一项公约或上一年的值。关于跨管辖区错误的索赔需要完整的同州参考集。我们将发布协议、黄金表和所有模型输出。