论文
CAPO:LLM 代理的约束感知提示优化
CAPO: Constraint-Aware Prompt Optimization for LLM Agents
摘要
大语言模型 (LLM) 越来越多地部署为依赖系统提示来使用工具和完成任务的代理。此类部署提出了不同的操作要求,包括适当的工具使用、简洁的提示和解决方案路径以及遵守安全和格式化策略。然而,对于许多从业者来说,将特定领域的监督数据组装到训练后模型来满足这些要求是不可行的。我们引入了 CAPO(约束感知提示优化),这是一种原始对偶方法,它将基于池的重写与自适应约束权重相结合,以在显式操作约束下优化系统提示。在代理基准测试中,CAPO 更可靠地达到经验上可行的操作点,同时提高任务性能。 CAPO 还超越了代理设置,在具有输出格式和安全/隐私限制的助理式评估中取得了出色的成果。我们进一步介绍了 DCAPO(动态训练的 CAPO),它使用基于池的 GRPO 训练反馈和双条件重写器,同时保持任务代理冻结。在不同规模的任务代理中,DCAPO 在每个评估的领域中生成可行的提示,并匹配或提高评估基线所实现的任务准确性。替代分析描述了有限池和离散重写错误如何进入不精确的原始对偶过程。