论文
在基于 LLM 的多代理提示优化中统一时间和结构贡献分配
Unifying Temporal and Structural Credit Assignment in LLM-Based Multi-Agent Prompt Optimization
摘要
虽然多智能体系统 (MAS) 使 大语言模型 能够通过协作交互来处理复杂的推理任务,但由于计算图的离散、不可微性质以及全局监控信号的稀疏性,优化其动态仍然是一项艰巨的挑战。现有的黑盒优化器很难将轨迹级故障归因于特定的局部组件,从而导致低效、高方差的探索。我们认为,易于处理的 MAS 优化需要结构性归纳偏差来理清误差信号。我们提出时间和结构贡献分配,它沿着两个轴分解目标:(i)时间信用,使用状态空间瓶颈来识别关键回合,以及(ii)结构信用,使用固定角色策略来隔离代理贡献。利用这些分解的信号,我们引入了一种离散的、语言化的块坐标下降算法来进行迭代细化。它不是不加区别的全局更新,而是在优化角色提示和聚合协议之间交替,使用 LLM 生成的“代理梯度”仅针对已识别的薄弱链接。在不同的推理基准中,我们的方法大大降低了查询复杂性,同时提高了性能,为自我改进 MAS 提供了一条有原则且可解释的路径。