论文
循环中的记忆:进程内检索作为语言智能体的扩展工作记忆
Memory in the Loop: In-Process Retrieval as Extended Working Memory for Language Agents
摘要
语言智能体运行“观察—推理—行动”循环,但它们推理所依据的记忆在循环之外:每回合最多查询一次的存储。我们研究记忆移入循环内、每步读写的regime。障碍一直是延迟:网络化存储需数十至数百毫秒应答,检索昂贵时循环内检索可把端到端延迟膨胀最高83倍。既往工作管理而非质疑该成本:服务层调度隐藏之,“记忆优先”设计把检索配给到每回合一次。我们论证延迟是存储所在位置的性质而非循环内模式的性质:进程内存储约100微秒应答——比网络regime低三个数量级,此速度下每步税坍缩。按扩展心智论题的parity原则,快到可持续直接可用的存储成为扩展工作记忆,而非智能体仅仅咨询的工具。前提是因果的:固定每回合记忆延迟预算、只变存储应答速度——冗余动作随延迟单调上升(进程内速度0/12,110ms云往返7.2/12;gpt-5-nano与mini;精确置换p=0.0079)。端到端演示:四类GPT-5级模型在有界窗口下,带循环内记忆把召回从0/5提升到3.6–4.8/5,存储操作p50 80–165微秒——不过指令化的每回复复述基线也能完美解决,只是token成本随工作集增长。存储在任何运行中都未丢失事实(244/244写入保持);每次未中都可追溯到智能体的读取策略而非存储。测量还重定位了瓶颈:每步主导成本是嵌入(网络约200–400毫秒);进程内存储配小型本地嵌入器把完整操作带回实测约40微秒。
