论文
CalBench:评估多代理中的协调与隐私权衡 LLM
CalBench: Evaluating Coordination-Privacy Trade-offs in Multi-Agent LLMs
摘要
个人人工智能助理开始充当代表,可以访问日历、收件箱和用户偏好。日历安排使信任问题变得具体:助理必须与其他助理协调,同时决定透露其所代表的人的哪些信息。我们引入 CalBench,这是一个在私人信息下进行多智能体日历调度的受控基准。在每项任务中,$N$ 代理管理单独的私人日历并安排一系列 $M$ 传入会议,同时最大限度地减少中断成本。由于没有代理可以检查另一个代理的日历,因此成功需要以语言为媒介的协调而不是集中规划。 CalBench 使用 CP-SAT 预言机解决方案和去中心化非 LLM 参考协议生成可解决的场景,从而能够在匹配的信息约束下评估任务成功、超额成本、通信效率、负担公平性和隐私泄漏。在七个模型系列中,我们发现仅完成就错过了重要的失败:代理将可避免的成本留在桌面上,沟通量并不能预测更少的遗憾,而保护隐私的沉默可能会剥夺队友公平负担分配所需的成本信息。 CalBench 提供了一个可重复的测试平台,用于研究自主助手在大规模部署之前是否可以代表用户进行协调。