论文

MarketBench:将AI智能体作为市场参与者进行评估

MarketBench: Evaluating AI Agents as Market Participants

智能体系统Agent任务评测

摘要

市场是协调AI智能体活动的一种有前景的方式,其理由与那些为更广泛的市场提供辩护的理由相似。为了有效参与市场,智能体需要对自身成功完成任务的能力及其成本拥有信息充分的信号。我们提出MarketBench,一个评估AI智能体是否具备这些能力的基准。我们使用软件工程基准SWE-bench Lite的93任务子集,并以六个近期发布的LLM作演示。这些LLM在成功概率和token使用量上都校准失准,由这些自我报告构建的拍卖偏离全信息分配。一项后续干预——把来自先前实验的能力信息加入上下文——改善了校准,但只是适度缩小了与全信息基准的差距。我们还记录了基于市场的脚手架与这些LLM配合的表现。我们的结果指出,自我评估是AI智能体市场式协调的一个关键瓶颈。