论文

TRACE:Agent 历史对上下文压缩损害的有限预测力

Does an Agent's History Tell You When Compaction Will Hurt? A Modest, Bounded Effect on the TRACE Paired-Replay Corpus

上下文与知识上下文工程

摘要

许多目光长远的智能体将其上下文压缩在全局规则上,通常是 token 预算,对智能体正在做的事情视而不见。我们询问智能体最近的行为是否可以预测压实何时会造成伤害。 TRACE 的 590 个 Harness 触发的 AppWorld 压缩边界的公共语料库会在预压缩上下文和摘要下重放来自重新执行的前缀状态的每个边界,并记录下一个操作的负担:调用错误或重复已进行的调用。我们发现边界前的历史对压实后损害的预测能力很弱。通过前缀放置在内部预先指定的对比度是一个宽的空值,并且其后面的天真的“已写入”标签结果证明可以测量轨迹相位。最佳扩展协议触发器达到 保留测试 AUROC 0.66(复制品自己的标签上为 0.64),而相同边界复制品为 0.72;最好的冻结、可解释的触发器可以避免 21% 的有害(正负载)边界,同时保留 84% 的压实机会,并且在计数上超过随机规则期望,但在负载质量上不超过随机规则期望(事后比较)。无法在发布时评估最佳触发器是否在匹配保留率下击败 token 预算规则。我们说明了语料库应该发送什么来回答这个问题。