论文
学习在不确定性下协调代理
Learning to Orchestrate Agents under Uncertainty
摘要
异构代理的自适应编排需要在不确定和不断变化的代理行为下做出顺序委托决策,例如,协调具有不同可靠性、成本和响应质量的专用人工智能模型。虽然代理编排的先前工作重点关注性能或成本,但代理可靠性和输出分布的不确定性通常不会在编排级别明确建模。在这项工作中,我们研究了不确定性下异构代理的自适应编排问题,其中元控制器必须决定何时委托给代理,同时考虑可靠性、成本和不确定性。我们提出了 BOT-Orch,这是一个轻量级框架,它将编排重新定义为代理上的强盗问题,并通过代理输出分布和特定于任务的参考分布之间的 OT 距离进行正则化。我们表明,在标准假设下,正则化编排享有 $\mathcal{O}(\sqrt{T})$ 遗憾,并且可证明在具有相同平均奖励但不同分布对齐的代理之间产生偏好排序。根据经验,我们证明 BOT-Orch 在具有异构、非独立同分布的合成但对抗性任务分配设置中优于标准老虎机和启发式基线。代理行为。