论文

MemOCR:面向高效长程推理的布局感知视觉记忆

MemOCR: Layout-Aware Visual Memory for Efficient Long-Horizon Reasoning

上下文与知识模型训练强化学习上下文工程记忆Agentic RLAgent记忆

摘要

长程Agentic推理需要有效地将不断增长的交互历史压缩进有限的上下文窗口。大多数现有记忆系统将历史序列化为文本,其中token级成本均匀且随长度线性扩展,常将稀缺预算花费在低价值细节上。为此,我们提出MemOCR,一个多模态记忆智能体,通过视觉布局以自适应信息密度分配记忆空间,在紧凑的上下文预算下改善长程推理。具体而言,MemOCR维护结构化富文本记忆(如标题、高亮),并将其渲染为图像供智能体查询访问,视觉上优先呈现关键证据,同时激进压缩辅助细节。为确保跨不同记忆预算的鲁棒性,我们使用预算感知目标下的强化学习训练MemOCR,使智能体接触多样的压缩级别。在长上下文多跳和单跳问答基准上,MemOCR优于强文本基线,并在极端预算下实现更有效的上下文利用。

MemOCR:面向高效长程推理的布局感知视觉记忆
图2:MemOCR 框架。(a) 记忆撰写(Memory Drafting,文本域):LLM 智能体基于新输入的 chunk 增量更新一份富文本记忆,通过格式与结构赋予视觉优先级。(b) 记忆读取(Memory Reading,视觉域):富文本被渲染为二维记忆图像,作为智能体回答查询的唯一工作上下文。(c) 预算感知的训练目标:我们在不同程度的记忆压缩下训练智能体。撰写(drafting)能力通过聚合优势更新,而读取(reading)能力通过各自独立的优势更新。