论文

基于概念的注意力:图注入注意力、时间版本控制和认知状态的受控评估

Concept-Grounded Attention: A Controlled Evaluation of Graph-Injected Attention, Temporal Versioning, and Epistemic Status

模型架构Transformer

摘要

知识密集型语言模型系统通常将外部知识表示为文本块或静态图,对概念演化、时间点推理以及验证知识和推断知识之间的区别的支持有限。我们引入了概念生命周期模型(CLM),它将概念表示为持久的、基于图的、时间版本化的实体,具有明确的出处和认知状态;以及基于概念的注意力(CGA),它通过图偏向自注意力(形式A)和概念节点上的门控交叉注意力(形式B)将概念图结构注入到Transformer计算中。我们使用禁用机制基线在受控设置中评估框架。在 200 个固定检索的 MuSiQue 和 HotpotQA 问题上,概念图检索可以恢复显式的多跳路径,但不会提高证据召回率。 Form A 似乎可以引导注意力,对黄金的关注度是干扰性概念的 2.76 倍,但当 Form A 被禁用时,比例相同;习得的偏差可以忽略不计,并且答案不会改变。身份保留形式 B 将 F1 从 0.188 提高到 0.221,但控制概念产生 0.213,表明大部分增益反映了容量的增加。在 LongMemEval 上,显式时间表示将所有测试生成器的答案准确性提高了 13 到 25 个点,参数高达 122B,而简化的 CLM 版本解析的性能与过时的序列化类似,因为概念标识没有可靠地建立。在合成源独立性任务中,协议衍生的认知状态将微调小模型中不受支持的断言从 28% 减少到 0.1%,在 72-122B 模型中从 19-68% 减少到 0-5%。总体而言,结果支持使时间有效性和认知状态变得明确,同时表明,如果没有禁用机制控制,图注意力诊断就无法提供信息。