论文
A3-Bench:经由锚点与吸引子激活评测记忆驱动的科学推理
$A^3$-Bench: Benchmarking Memory-Driven Scientific Reasoning via Anchor and Attractor Activation
摘要
科学推理不仅依赖逻辑推断,还依赖激活既有知识与经验结构。记忆能够高效复用知识并增强推理的一致性与稳定性。然而,现有基准主要评估最终答案或逐步连贯性,忽视了人类推理背后的记忆驱动机制——即激活锚点(anchor)与吸引子(attractor),并将其整合进多步推断。为弥补这一空白,我们提出A3-Bench,一个通过双尺度记忆驱动激活、扎根于锚点与吸引子激活来评测科学推理的基准。首先,我们使用SAPM流程(subject,anchor & attractor,problem,memory developing)跨领域标注2,198个科学推理问题。其次,我们引入利用锚点与吸引子的双尺度记忆评估框架,以及度量记忆激活率的AAUI(Anchor–Attractor Utilization Index)指标。最后,通过多种基座模型与范式的实验,我们验证了A3-Bench,并分析记忆激活如何影响推理表现,为记忆驱动的科学推理提供洞见。
