论文

Sibyl:用于长期任务的高效小大型模型协作框架

Sibyl: An Efficient Small-large Model Collaboration Framework for Long-horizon Tasks

智能体系统Agent 工具调用

摘要

小语言模型 (SLM) 通过低延迟、资源高效的推理为设备上的智能体提供了有希望的基础,但有限的推理和规划能力限制了它们在需要与环境进行多步骤交互的长期任务上的性能。 SLM 和更大的云托管模型之间的步骤级协作可以弥合这一差距,但确定需要云协助的状态仍然具有挑战性:每个云调用的贡献与后续操作纠缠在一起,并且只能根据最终任务结果进行评估。使这一挑战更加复杂的是,SLM 必须平衡两个相互竞争的目标:最大化任务成功率和最小化云调用。为了解决这个问题,我们提出了 Sibyl,一种训练 SLM 智能体在步骤级别有选择地咨询云模型并将其指导内化为后续决策的算法,以最小的云依赖实现强大的任务性能。 Sibyl 遵循三阶段训练管道:(1) 通过免咨询的自我进化强化学习 (RL) 构建强大的基础策略; (2)通过决定性分歧状态挖掘冷启动协商行为; (3)通过咨询感知强化学习共同优化咨询决策和指导内化。 ALFWorld 和 WebShop 上的实验表明,Sibyl 仅使用 0.6B-参数模型,其成功率分别优于最先进的基线(包括智能体、训练和路由方法)95.2% 和 80.4%,而每个轨迹平均仅 0.8 次和 3.9 次云调用。

Sibyl:用于长期任务的高效小大型模型协作框架的原论文方法或结果图
图 2:Sibyl 的三阶段训练管道,它训练 SLM 在本地操作,在关键步骤咨询云,并将其指导内部化,以通过很少的云调用实现高任务成功率。