论文
PRO-LONG:用程序化记忆支持长程推理
PRO-LONG: Programmatic Memory Enables Long-Horizon Reasoning
摘要
长程任务要求持续的感知、推理与探索,是大语言模型(LLM)智能体的持续挑战。该差距体现在它们在ARC-AGI-3等持续学习基准上的有限表现——尤其当模型被开箱即用评估时。各类智能体运行框架被提出以弥合差距,每个都为处理长观测序列提交一种策略:从环境保存什么信息、如何加载进模型上下文——我们认为这一选择尤其关键。现有上下文管理方法面临显著权衡:保存更多信息使检索相关细节更难驾驭。我们提出PRO-LONG,一个围绕程序化记忆构建的最小上下文管理框架,面向长程探索性设定中的LLM智能体。PRO-LONG以保持完整的结构化交互日志、并借力编码智能体的近期进展来高效搜索该历史的方式化解权衡。在ARC-AGI-3全公开游戏集上,PRO-LONG较基础编码智能体平均提升18.0个百分点(跨前沿模型),匹敌或超过最先进的专用运行框架(最高76.1% pass@1),同时使用少4.2–5.8倍的token。使用Fable 5,PRO-LONG以总计1,750美元成本取得97.4%的best@2。相关代码与日志见https://github.com/alexisfox7/PRO-LONG。