论文
PACE:小语言模型代理的两次时间尺度自我进化
PACE: Two-Timescale Self-Evolution for Small Language Model Agents
摘要
在生产中部署语言模型代理通常需要大量的计算和人力来调整提示、解析器、验证器和代理管道的其他组件。自我进化提供了一种有前途的替代方案,但大多数现有框架都假设可以访问前沿模型,这些模型可以可靠地诊断故障、提出修订并判断自己的更新。我们研究冻结的小语言模型(SLM)是否可以在资源限制下充当有效的自我进化代理。我们提出了 PACE(提示和控制逻辑演进),这是一个两个时间尺度的框架,用于协调低风险提示细化与高风险控制逻辑更新。 PACE 在固定控制逻辑下发展提示,直到提示级别增益饱和,然后考虑通过保留验证接受的约束控制逻辑更新。在从 4B 到 14B 参数的三个冻结 SLM 主干和四个受控基准中,PACE 在所有 12 个主干-基准组合上实现了最佳性能,比普通 SLM 代理提高了高达 +9.2% 的相对改进,比更强的单模演进基线提高了高达 +5.4% 的相对改进。 tau-bench 案例研究进一步表明,与普通进化和仅提示进化相比,PACE 提高了多回合工具使用的成功率。这些结果表明,可靠的 SLM 代理自我进化是可能的,无需更新模型权重或依赖前沿模型教师,并且关键好处不是任何单一的最终求解器模式,而是自主、经过验证的适合任务的推理策略的发现。