论文
面向长程科学智能体的情节-语义记忆架构
Episodic-Semantic Memory Architecture for Long-Horizon Scientific Agents
摘要
随着大语言模型(LLM)演化为持久的科学协作伙伴,上下文窗口饱和已成为关键瓶颈。涉及迭代数据分析与假设精化的科学工作流,会以密集的技术内容迅速填满即便是扩展后的上下文,而整体式方法则受制于二次方成本增长与认知退化。我们评估了一种双过程记忆架构,它将即时的情节需求(恒定的10条消息窗口)与长期固化知识(以每条消息约3个token的速度增长)解耦。与以往面向社交智能体的记忆系统不同,我们面向领域的固化过程处理了相互矛盾的参数演化、跨实验阶段的多跳推理以及精确技术事实的保留。通过覆盖15,000条消息的大规模评估,并在来自三个家族(OpenAI、Anthropic、Google)的六个LLM上进行跨模型验证、共计1,440次查询,我们确立了三个关键发现。第一,全上下文模型在10,000条消息时因上下文溢出而失效,而我们的系统以1-2秒的延迟、少62%的token(45,434对120,000+上限)维持70-85%的准确率。第二,跨模型验证揭示了独立于具体LLM的架构级权衡:双过程架构擅长数值/时间类查询(65-90%准确率),而RAG擅长历史检索(60-85%),这提示二者是互补的部署策略。第三,我们发现了一种“仿真到真实”(Sim-to-Real)差距:合成测试中记忆保持恒定,而真实工作流呈现线性增长(约每条消息3个token),固化质量成为首要的可扩展性瓶颈。该架构成功管理了包含14,000+条科学事实(125k token)的档案,表明面向领域的记忆固化能够支撑超越全上下文极限的持续运行。
