论文

LLM 智能体低秩适应的行为商数学习

Behavior Quotient Learning for Low-Rank Adaptation of LLM Agents

模型训练参数高效训练

摘要

基于LLM的代理依靠异构交互能力来完成复杂的任务。现有方法通常将这些功能分布在多个 LoRA 适配器上,这增加了适配器存储要求并在推理期间引入了路由开销。单个 LoRA 可以避免这种开销,但在固定排名预算下从不同的智能体轨迹中学习会带来两个挑战。首先,具有不同交互轨迹和参数梯度的轨迹可以引起决策分布的等效变化,导致重复更新过分强调多余的行为变化。其次,聚合更新可能超出适配器的排名预算,并且在权重空间中对其进行近似可能会扭曲其预期产生的决策变化。我们提出了 BQ-LoRA,一种低秩适应框架,通过局部行为商流形组织轨迹更新。它包含两个模块,即行为商平衡(BQB)和决策保留压缩(DPC)。 BQB 根据决策分布构造商流形,并根据商切线空间中的局部密度重新加权轨迹更新方向。 DPC 将平衡梯度投影到固有的固定秩切空间上,并通过联合控制有效权重误差和决策分布的失真来重构结果目标。 AppWorld 和 BrowseComp-Plus 上的实验将 BQ-LoRA 与标准 LoRA 和最近的低秩适应方法进行了比较,同时单独的消融评估了两个组件的互补贡献。