多智能体语言模型中的道德风险
Moral Hazard in Multi-Agent Language Models
摘要
当具有社会价值的努力成本高昂、难以观察并且主要使他人受益时,合作可能会失败。对话道德风险博弈以 Holmstrom 的团队道德风险模型为基础,将这种隐藏动作结构实例化为语言代理的文本环境。代理可以在保留即时本地奖励和支付查询成本之间进行选择,以揭示有助于另一个代理下游决策的隐藏安全事实。我们使用信息获取、沟通、下游使用和团队成功的衡量标准来评估十四个开放权重模型和四个前沿模型。在匹配的每个模型 3,015 个决策的实验中,GPT-5.6 Sol、Claude Opus 4.8 和 Nemotron-3 Ultra 跟踪跨九个查询成本得出的私有共享边界,平均绝对误差为 0.013、0.030 和 0.024。 Muse Spark 1.1 定向响应,而《神鬼寓言 5》仍然处于查询饱和状态。 SFT、RLOO、SFT+RLOO 和 GEPA 产生异构机制变化。 GEPA 将 Muse 团队的成功率从 22.2% 提高到 100.0%,同时将查询使用率从 51.1% 降低到 0.3%。冻结提示干预表明,这种成功取决于学习的排名标签映射,而不是直接启示:改变映射会将团队成功率从 100.0% 降低到 12.5%,然后是 0.0%。我们引入了 CREDIT(证据驱动信息传输的反事实重放),这是一种机制一致的多智能体提示优化算法,它使用匹配的隐藏状态双胞胎和总动作重放来奖励稳健的因果贡献而不是查询频率。在五个模型和多个种子中,CREDIT 保留了查询介导的行为,同时揭示了特定于模型的获取和下游使用瓶颈。优化可以通过直接揭示或学习的有效信息结构达到相同的总体结果,从而激发机制层面的评估和优化,而不仅仅是团队的成功。