论文
检测不等于解决:检索增强LLM中的监控-控制鸿沟
Detecting Is Not Resolving: The Monitoring Control Gap in Retrieval Augmented LLMs
摘要
检索增强LLM被部署于证据质量决定行动安全的任务,然而现有评测协议假设单轮鲁棒性可以预测证据跨轮累积时的鲁棒性。我们证明这一假设在根本上是错误的。模型表现出监控-控制鸿沟:它们轻易承认相互矛盾的证据,但这种觉察未能约束其最终建议——检测到认知冲突并不意味着能安全地解决它。通过跨四个模型家族(1.5B-32B参数)、超过50000次轮级评估的多轮文档累积协议,我们证明:单轮诊断会系统性高估RAG安全性;承认矛盾与安全解决之间不相关,这一模式得到了针对性人工验证的印证;且不存在通用的提示词修复方法。相互印证的机制证据——隐状态探测、注意力分析与响应策略分类——指向动作选择是该缺陷最可能的位置:与危险相关的信息在内部被表征并在不安全生成期间获得增强的注意,却未能约束输出行为。在检索增强系统能够在高风险场景中被信任之前,模型所识别的内容与其实际所为之间的鸿沟必须被测量并弥合。
