论文

没有保真度的多样性:多代理 LLM 协商模拟中的求解器-采样器不匹配

Diversity Without Fidelity: A Solver-Sampler Mismatch in Multi-Agent LLM Negotiation Simulation

模型评测模型能力评测

摘要

语言模型越来越多地用于模拟人:调查受访者、谈判者、政策演习中的利益相关者。在这个角色中,模型应该重现人们的合理行为:犹豫、迟到、接受不完美的交易,而不是采取最好的行动。我们将其称为采样器角色,与寻找最佳移动的求解器角色形成对比,并且我们测试推理模式提供者如何在求解器影响模型时增强模型。我们的测试平台是多方谈判:五个Agent就一项法规进行十五轮讨价还价,未解决的问题由权威机构决定。没有对谈判进行结构化记忆的Agent几乎永远不会达成协议,无论推理是否开启:315 次此类运行中有 314 次以权威机构的决定结束。推理的改变在于失败的外观。在启用推理的情况下,一个模型家庭可以明显地进行谈判,在大多数运行中采取不同的动作、让步,并且每次都选择不同的路径,但在十五个运行中的十五个运行中仍然无法达成一致。多样性检查将通过一个结局永远不会改变的模型。进一步的两个结果显示了任务许可协议:当Agent在谈判中写下自己的简短运行笔记时,协议就成为常态,而提供现成的相同笔记不会改变任何事情;遵循教科书让步策略的手工编码代理在大多数运行中都在相同规则下达成一致。因此,模拟管道应该将模型作为采样器,根据它们产生的结果的分布进行审查。作为采样器的保真度必须单独进行测试:解算器强度并不能指导它,并且打开推理后它会留在原来的位置。