论文

FACTWASH:捕捉人工智能重写,将传闻变成事实

FACTWASH: Catching AI Rewrites That Wash Hearsay into Fact

AI 基础设施AI安全与内容治理基础设施

摘要

人工智能系统不断重写信息:对话变成存储的记忆,文档变成答案。重写可以保留一个主张,同时洗掉使它可检查的内容、谁说的、他们有多确定、何时成立。我们将这种失败称为事实清洗,并发布事实清洗,这是一个开源的写入时门,可以通过命名标志和证据而不是 LLM 判断来确定性地捕获它。构建它回答了一个实际问题:什么时候廉价支票就足够了,什么时候需要模型?决定因素是该房产是否拥有有限的表面线索库存。显式否定提示接近可枚举,因此单词列表完成并转移,在未调整的文本上达到 0.91 F1。对冲和归因具有开放式实现,因此词汇量在接近一半的回忆中保持稳定,并且一个问题 LLM 证人以相同的精度恢复了 +17 和 +15 点的提示检测回忆。部署后,该证人可能只会降低裁决,因此它购买的是精确性而不是覆盖范围。我们测量了 105,596 个独立注释句子的线索检测。然后,盲标记的内存写入语料库会定位故障:对话道听途说中的不良写入占 55%,商业电子邮件中占 7% (p < 0.001),因此第一个部署问题不是使用哪个检测器,而是是否会发生故障。在未经修改的 mem0 2.0.7 上,门标记了 8 个对冲传闻写入中的 5 个。