论文
长程多智能体商业交互中的失实与不当通信
Emergent Misaligned Communication in Long-Horizon Multi-Agent LLM Commerce
摘要
Frontier LLM 代理越来越多地代表单独的委托人进行交易,通常使用自然语言而不是结构化 API。许多安全文献研究通过对单个代理或程式化任务的对抗性诱导评估来错位 LLM 行为。它在结合了长远视野、独立主体、真实运行状态和主体间自然语言交换的环境中的普遍性和结构仍然没有得到充分的衡量。我们研究了 Vending-Bench Arena 20 次为期一年的模拟运行中的 2,583 封代理间电子邮件,Vending-Bench Arena 是一个跨越 13 个前沿 LLM 的竞争性自动售货环境。我们将言语行为不一致操作为包含虚假事实主张、操纵、共谋或威胁的电子邮件,将消息内容与 真值 模拟器状态和记录的推理跟踪相结合,以对此类行为进行分类和验证。在我们的主要分类器下,12.6% 的电子邮件被标记为未对齐;错位出现在所有 20 次运行中以及 74.7% 的单个代理运行中。在不同采样温度下的重复分类以及来自其他两个前沿模型系列的判断的全管道复制下,这种错位的幅度和组成都被保留。错位也是相互的和压力调节的:收到来自交易对手的错位电子邮件会使回复错位的几率提高 1.65 倍,而低库存情况会使回复错位的几率提高 1.58 倍。在能力不对称利用的测试中,我们没有发现任何证据表明能力较高的模型会差异性地利用较弱的交易对手,并且模型性能排名不能预测错位率。总之,这些结果表明,在没有经过工程诱导的竞争性多智能体环境中,可能会出现可测量的、与状态相关的失调,其模式与操作稀缺性和交易对手行为相关,而不仅仅是模型能力。