论文

WiCER:LLM Wiki 系统的 Wiki 记忆编译、评估、细化迭代知识编译

WiCER: Wiki-memory Compile, Evaluate, Refine Iterative Knowledge Compilation for LLM Wiki Systems

摘要

LLM Wiki 模式将领域知识编译并提供到持久工件中,并通过 KV 缓存推断将其提供给 LLM,承诺以亚秒延迟进行上下文访问,并且零检索失败。认识到这一点需要解决编译差距:LLM 编译将原始文档提取到 wiki 中,而不会灾难性地丢弃关键事实。我们描述了 17 个 RepLiQA 领域(6,800 个问题)中的这一差距:我们观察到,完整上下文 KV 缓存推理在精选知识上优于 RAG(5 分中的 4.38 比 4.08,TTFT 快 7.3),但由于注意力稀释而在规模上降级到低于 RAG,并且盲编译完全失败(2.14 到 2.32 比 3.46,53 到 60%)灾难性的故障率)。为了解决编译差距,我们提出了 WiCER(Wiki 记忆编译、评估、优化),这是一种受反例引导抽象细化 (CEGAR) 启发的迭代算法,可以弥补这一差距。 WiCER 根据诊断探针评估已编译的 wiki,识别丢失的事实,并强制在后续编译中保留它们。一到两次迭代可以恢复 80% 的质量损失(具有基线的 15 个主题的原始完整上下文的平均值为 3.24 与 3.47),相对减少了 55% 的灾难性故障。对所有 17 个主题的消融证实了有针对性的诊断 (+0.95),而不是一般固定 (+0.16),推动了收益。所有代码和基准测试均已发布,用于可重复的研究。