流媒体知识编译:针对时间演变的主动实质性评分固定 LLM Wiki
Streaming Knowledge Compilation: Proactive Materiality-Scored Pinning for Time-Evolving LLM Wikis
摘要
LLM wiki 系统将知识编译到预先填充的 KV 缓存中以进行高效推理,但假设静态语料库——只要底层信息环境发生变化,这种假设就会失败。我们将流知识编译形式化:给定一个文档流、一个固定的 词元预算 以及在摄取时未知的未来查询,维护一个已编译的 wiki,以完美的远见最大限度地减少对离线预言机的累积遗憾。促成洞察力是一个重要性信号 $φ_t(k,n)\in[0,1]$,它在 $t$ 时刻对实体 $k$ 的文档重要性进行评分,充当查询到达之前主动固定的查询相关性代理;我们证明了 $O(\sqrt{T\log K})$ 后悔界限,其中 $\varepsilon=\mathbb{E}[|φ_t-\hatφ_t|]$ 是唯一的特定于域的量。我们在两个领域进行实例化:金融,其中 $φ_t$ 是由冻结的 Llama 3.1 8B 分类头预测的异常股票波动率(76K 篇文章的 AUROC = 0.728,严格的时间分割;预测材料文章的已实现远期波动率高出 1.49 倍);和维基百科,其中 $φ_t$ 是异常编辑比率 (AER),一种横截面归一化编辑速度 - 表明相同的算法可以推广到金融领域之外。对 173 个匹配对(金融)和 119 个匹配对(维基百科)的端到端 QA 评估揭示了 后训练 知识中普遍存在的 LLM-as-judge 混淆,确立了遗憾分析(而不是绝对 QA 分数)是编译知识系统的可靠评估指标。财务累积遗憾收敛至-20.0(-0.12/步);维基百科达到+16.0(+0.13/步),积极的标志确认维基百科编辑内容确实是后训练——更丰富的上下文不断提高分数(没有Wiki 3.80 vs. Oracle 4.74)——并消除了这种混乱。 $O(\sqrt{T\log K})$ 保证适用于可以从流信号预测知识差距的任何领域。