论文
竞争性LLM代理对秘密工具的自愿共谋
Voluntary Collusion with Secret Tools in Competing LLM Agents
摘要
即使一个工具被明确描述为对他人不公平且有害,表面上看已具备安全对齐的 LLM 代理仍会在能带来策略优势时自愿参与秘密共谋。为研究这一现象,我们引入一个建立在两个策略性多代理环境之上的实证框架:Liar's Bar(一个竞争性欺骗场景)和 Cleanup(一个混合动机的资源管理场景),在这些场景中,代理会获得秘密共谋工具,这些工具带来显著优势,同时明显损害其他代理的利益。在 12 个模型(7B、70B 和专有规模)和 6 种提示变体上,我们发现大多数代理会持续接受这些工具并发展出共谋策略,同时在接受之前明确承认这些工具的不公平性。我们进一步表明,不公平标签和基线对齐本身都不能可靠地阻止共谋:只有显式的伦理框架能降低采用率,而即便如此,较小的模型仍然易受影响。更广泛地说,我们的工作首次系统研究了基于 LLM 的多代理系统中自愿共谋的采纳问题,并表明防止此类行为需要显式保障措施,而不能依赖一般性的对齐。
