论文
评估数据驱动科学发现中 编码智能体 的记忆压缩策略
Evaluating Memory Condensation Strategies for Coding Agents in Data-Driven Scientific Discovery
摘要
编码智能体 在长时间运行的任务中积累了广泛的上下文,但固定的上下文窗口迫使从业者在截断和任务失败之间做出选择。虽然已经提出了许多记忆压缩策略,从简单的滑动窗口到 LLM 生成的摘要,但不存在系统比较来指导策略选择,特别是在科学发现任务中。我们使用 GPT-4o 在跨越 6 个科学领域的 60 个 DiscoveryBench 任务上评估了 8 种记忆压缩策略(总共 480 项评估)。我们发现没有冷凝器会显着改变假设质量,而基于 LLM 的冷凝器将词元成本增加了 24-94%,并且屏蔽工具调用输出实现了 8.6% 的净节省。我们还观察到,数据驱动的科学发现的最佳冷凝器因科学领域和任务长度而异。