论文

A3-Bench:经由锚点与吸引子激活评测记忆驱动的科学推理

$A^3$-Bench: Benchmarking Memory-Driven Scientific Reasoning via Anchor and Attractor Activation

模型评测基准与评测资源

摘要

科学推理不仅依赖逻辑推断,还依赖激活既有知识与经验结构。记忆能够高效复用知识并增强推理的一致性与稳定性。然而,现有基准主要评估最终答案或逐步连贯性,忽视了人类推理背后的记忆驱动机制——即激活锚点(anchor)与吸引子(attractor),并将其整合进多步推断。为弥补这一空白,我们提出A3-Bench,一个通过双尺度记忆驱动激活、扎根于锚点与吸引子激活来评测科学推理的基准。首先,我们使用SAPM流程(subject,anchor & attractor,problem,memory developing)跨领域标注2,198个科学推理问题。其次,我们引入利用锚点与吸引子的双尺度记忆评估框架,以及度量记忆激活率的AAUI(Anchor–Attractor Utilization Index)指标。最后,通过多种基座模型与范式的实验,我们验证了A3-Bench,并分析记忆激活如何影响推理表现,为记忆驱动的科学推理提供洞见。

A3-Bench:经由锚点与吸引子激活评测记忆驱动的科学推理
图5:A 3 A^{3} -Bench 数据集的结构及其在 HybridRAG 框架中的使用方式。(a) memory twin-needle activator。(b) context fabric composer。