论文

评估自然语言中的理性缔约

Evaluating Rational Contracting in Natural Language

智能体系统Agent任务评测

摘要

基于语言的AI智能体的出现有望改变机器经济活动的范围。此类智能体不再只是提出报价或遵循硬编码协议,而是可用于在开放式的自然语言中谈判并执行协议。然而,对这些能力的大多数评估聚焦于一次性交换或简单经济博弈,留下了语言所能表达的延时性、附条件性与不完全性契约这一丰富空间未被覆盖;它们还只关注原始利润,而未衡量可信缔约所需的品质。为此,我们构建了一个理性框架,规定智能体在不确定的多步环境中应如何谈判和履行自然语言契约。在该框架内,我们开发了量化理性行为与合作行为的指标和基线。为评估智能体在此类缔约上的表现,我们将该框架实例化为ContractSim——一个评估套件,其中两名玩家在环境不确定性与玩家间不确定性下谈判并执行多轮供应商契约。跨越六个环境和三种供应商场景(餐饮、酒店清洁和AI托管),我们发现当前基于大语言模型(LLM)的智能体能可靠达成协议,并在环境不确定性低时谈判出高效契约。然而在高不确定性下,它们常常无法谈判出可满足、高效或互利的契约。它们在执行契约时也常常不合作,即使契约容易满足,也会为额外利润违反契约条款。这些发现凸显了能够理性且合作地谈判、解释和执行契约的语言智能体在设计上的改进空间。

评估自然语言中的理性缔约:论文配图
图1:用ContractSim评估缔约。谈判阶段:两个LLM智能体在各自私有信息的条件下谈判一份自然语言餐饮合同。履约阶段:被接受的合同随后在交替的付款/生产周中履行,其间存在随机价格、损耗和配送损失。我们在每个阶段将表现与理性基线进行基准比较,从而研究LLM智能体能在多大程度上充当理性且合作的缔约方。