论文
AgenticSTS:长程LLM智能体的有界记忆试验台
AgenticSTS: A Bounded-Memory Testbed for Long-Horizon LLM Agents
摘要
长程LLM智能体的记忆是关于每个未来决策允许看见什么的契约。最简单的契约将过去观察、工具调用与反思附加到每个提示——使先前上下文易于访问但也把它变成大杂烩——任何单个记忆组件的效果都难以隔离。我们引入并测量一种替代的有界契约:每个决策都从经类型化检索组装的全新用户消息做出——不附加原始跨决策转录。提示因此在任意长度的运行中保持有界——任何单层都可被单独消融。我们在Slay the Spire 2中实例化该契约——一款封闭规则随机卡组构筑游戏——其单局需要数百个战术与战略决策。同一游戏上前沿LLM的公开在线基准在最低难度的五种配置下报告零胜——而开发者报告的同一难度人类胜率为16%:该任务困难但未饱和。在我们的测试框架内,固定A0消融显示触发战略技能时观察到最大差异:无存储基线赢3/10局——加技能层赢6/10。在该样本量下该比较是方向性的而非统计决定性的(Fisher精确检验 p≈0.37);跨骨干探针与公开累积上下文基线作为操作性比较报告——而非契约变量本身的受控测试。我们发布可复现试验台:298条带条件标签的完整轨迹、冻结的记忆/技能快照、提示记录与分析脚本——一个智能体设计与一套经过验证、可复用的方法学——用于研究显式记忆层如何塑造长程LLM智能体决策。
