论文

评估数据驱动科学发现中 编码智能体 的记忆压缩策略

Evaluating Memory Condensation Strategies for Coding Agents in Data-Driven Scientific Discovery

模型评测上下文与知识上下文工程评测方法与指标

摘要

编码智能体 在长时间运行的任务中积累了广泛的上下文,但固定的上下文窗口迫使从业者在截断和任务失败之间做出选择。虽然已经提出了许多记忆压缩策略,从简单的滑动窗口到 LLM 生成的摘要,但不存在系统比较来指导策略选择,特别是在科学发现任务中。我们使用 GPT-4o 在跨越 6 个科学领域的 60 个 DiscoveryBench 任务上评估了 8 种记忆压缩策略(总共 480 项评估)。我们发现没有冷凝器会显着改变假设质量,而基于 LLM 的冷凝器将词元成本增加了 24-94%,并且屏蔽工具调用输出实现了 8.6% 的净节省。我们还观察到,数据驱动的科学发现的最佳冷凝器因科学领域和任务长度而异。