论文

超越提示或技能?模块化 LLM 课程的归因引导优化

Beyond Prompt or Skill? Attribution-Guided Optimization of Modular LLM Programs

智能体系统Agent HarnessAgent Skills

摘要

大语言模型可以解决日益多样化的推理任务,但它们的性能对任务提示、中间指令以及可重用的问题解决知识的整合方式仍然高度敏感。现有的优化方法通常只关注该设计空间的一部分:它们要么优化整体提示,要么从模型跟踪中单独诱导和细化技能。因此,他们缺乏原则性的机制来决定发生故障时应该更新哪个组件,并且很少在统一的框架中优化提示、技能和技能使用策略。我们提出了 SPARO(技能、提示和路由优化),这是一个联合优化任务指令、可重用技能块和路由规则的框架。它执行受控的反事实评估,将示例的效果转换为提示、技能和路由​​组件上的概率责任分布,从该分布中采样一个组件,并应用相应的目标突变。这种设计将语言程序优化从全局提示重写转向结构化、可重用和选择性激活的任务知识。在五个基准和五个工作模型中,SPARO 始终优于以提示为中心和以技能为中心的优化基准。这些结果表明,有效的语言程序优化不仅取决于发现有用的任务知识,还取决于决定这些知识应该存储在哪里以及何时应该激活。