论文
有据续写:面向LLM对话的线性时间运行时验证器
Grounded Continuation: A Linear-Time Runtime Verifier for LLM Conversations
摘要
在长对话中,LLM可能产出听起来合理、却建立在对话早已放弃的前提之上的下一句话语。针对已部署智能体的上下文操纵攻击正在主动利用这一缺口。我们用一个维护显式依赖图的运行时验证器来封堵它:LLM将每轮对话分类为来自四种形式体系(动态认知逻辑、溯因推理、觉知逻辑、论辩)的8种更新操作之一,符号引擎记录哪些论断依赖哪些证据。检查续写是否有依据可归约为图遍历;撤回在同一图中传播,恰好标记失去支持的结论,每轮成本为线性并具有形式化的无冲突保证。在LongMemEval-KU oracle(n=78)上,验证器达到89.7%准确率,对比纯LLM基线的88.5%(+1.3个百分点)和按检索预算对齐的transcript-RAG基线的87.2%(+2.6个百分点);分歧中的胜出项是基线在编造时验证器正确弃答的情形。在LoCoMo的60个官方问答项上,验证器与检索增强基线相当。除外部基准外,我们构建了两个多智能体场景和一个50项落地性测试:在15项陈旧前提子集上,验证器达到100%准确率,对比93.3%(+6.7个百分点)。这些实例化了一个可靠性-忠实性分解:结构检查在构造上是可靠的,而每次部署的LLM抽取忠实性则是我们在四个LLM家族上测量的经验问题。撤回检查稳定在微秒量级,而历史重放随对话长度线性增长。