论文

LEAP:学习高效动作提议加速LLM智能体

LEAP: Learning Efficient Action Proposals For LLM Agents

模型推理投机采样

摘要

LLM智能体的rollout很慢:任务一步步完成,每步先推理再选动作,上一步完成后下一步才能开始。投机解码在推理阶段通过起草与验证加速;近期工作也开始把类似思想用于动作阶段:用现成模型(通常很大)起草动作提议交目标模型验证。大起草者更常匹配目标但提议更慢,小现成模型快但很少与目标同决策。我们提出更一般的问题:什么决定动作推测的端到端加速?为此我们建立投机回合的延迟框架,比较每轮所得与所费:所得取决于起草者对目标的预测质量及任务在结束前可进行的步数;所费来自起草、等待目标验证与执行工具。在该框架引导下,我们提出LEAP(学习高效动作提议):保持草稿模型小、用目标动作序列训练使其准确。0.6B小模型在多数决策上与目标一致,使智能体端到端墙钟时间最高快60%,任务成功率无系统变化。跨数据集、目标与草稿模型,该框架解释了绝大部分实测加速。我们还表明草稿模型可在线训练而无需先验轨迹收集,并与离线训练性能相当,使LEAP适合真实部署。