论文

AGORA:面向LLM智能体免推理提示压缩的适配器锚定观察-动作保留

AGORA: Adapter-Grounded Observation-Action Retention for Inference-Free Prompt Compression in LLM Agents

上下文与知识上下文工程

摘要

广泛用于通用LM上下文的词元级抽取式压缩器在结构上不适用于LLM智能体:在横跨两个独立词元级方法族的17个(环境、骨干、方法)组合中,尽管实现了1.3-13.3倍的压缩,每个组合的平均奖励都崩塌至 <= 0.05。我们将这一失效模式命名并刻画为动作语法破坏——承载动作语义的词元(标识符、括号、动作动词)恰好是自信息量排名最低的词元,因此通用压缩器必然将它们移除,而环境会拒绝压缩后的残片。这一诊断指向步级粒度压缩。我们提出AGORA,一个免推理的步级压缩器,它结合了结构化提示解析器、面向格式关键与时近关键内容的始终保留下限,以及一个在反事实“下一步动作变化”标签上训练的125M参数相关性打分器(每步约2毫秒,零每步LLM开销)。在所比较的免推理与基于LLM的方法中,AGORA是唯一在9个组合中的8个里保持 >= 75%未压缩性能的方法(唯一例外为73%);四路组件消融将结构性保留下限隔离为主导质量杠杆,而学习到的打分器则是从单一固定保留比实现1.0-11.5倍自适应端到端压缩的来源。

AGORA:面向LLM智能体免推理提示压缩的适配器锚定观察-动作保留:论文配图
图 1:AGORA 概述。在每个步骤 tt 中,智能体的轨迹 τt\tau_{t} 被解析为角色类型块(csysc_{\text{sys}}:系统,ctaskc_{\text{task}}:任务,{si}\{s_{i}\}:过去(动作、观察)步骤,cnowc_{\text{now}}:当前观察,cpendc_{\text{pend}}:待处理助手)并压缩为三个子阶段。第 1 层(质量层)无条件保留 {csys,ctask,cnow,cpend}\{c_{\text{sys}},c_{\text{task}},c_{\text{now}},c_{\text{pend}}\}、最后 Krecent=2K_{\text{recent}}{=}2 个步骤,以及记分器标记的任何过去步骤pi>θhi=0.9p_{i}{>}\theta_{\text{hi}}{=}0.9。第 2 层(相关性评分器)是一个 125125M 参数的 RoBERTa,其输出 pi=P⁡(ritic∣cnow)p_{i}{=}P(\text{ritic}\mid c_{\text{now}})。第 3 层(贪婪字符预算填充)按 pip_{i} 对剩余的过去步骤进行排名,并填充剩余字符预算 B=ρ​|τt|B{=}\rho\,|\tau_{t}| (ρ=0.25\rho{=}0.25)。压缩上下文τ~t\tilde{\tau}_{t}(目标字符预算ρ=0.25\rho{=}0.25;实现的端到端压缩在单元之间变化1.01.0–11.5×11.5\次,参见§4.3)然后被发送到冻结主干;虚线返回路径标记从第 2 层回到第 1 层的高置信度覆盖。