论文
ROAD:经由自动调试的反思式优化实现零样本 Agent 对齐
ROAD: Reflective Optimization via Automated Debugging for Zero-Shot Agent Alignment
摘要
自动提示优化(APO)已成为提升大型语言模型(LLM)性能的关键技术,但当前最先进方法通常依赖大型、带标注的黄金标准开发集来为进化或强化学习(RL)方法计算适应度分数。然而在现实软件工程中,这类精心整理的数据集在 Agent 开发初期的冷启动阶段很少存在,工程师面对的是混乱的生产日志和不断演化的失败模式。我们提出 ROAD(Reflective Optimization via Automated Debugging),一个新颖框架,它将优化视为动态调试调查而非随机搜索,从而绕过对精炼数据集的需求。与传统变异策略不同,ROAD 使用专门的多 Agent 架构——包括负责根因分析的分析器(Analyzer)、负责模式聚合的优化器(Optimizer)和负责策略整合的教练(Coach)——将非结构化失败日志转换为稳健、结构化的决策树协议。我们在一个标准化学术基准和一个生产环境知识管理引擎上评估 ROAD。实验结果表明 ROAD 具有很高的样本效率,仅在三次自动迭代内就使成功率提升5.6个百分点(从 73.6% 到 79.2%),搜索准确率提升 3.8%。此外,在零售域的复杂推理任务上,ROAD 相对基线将 Agent 性能提升约 19%。这些发现表明,模仿人类工程中失败分析与修补的闭环,为部署可靠 LLM Agent 提供了一种可行的、数据高效的替代方案,可替代资源密集型的 RL 训练。
