论文

CoffeeBench:异构多智能体经济中长程LLM智能体基准

CoffeeBench: Benchmarking Long-Horizon LLM Agents in Heterogeneous Multi-Agent Economies

智能体系统Agent任务评测长程任务评测

摘要

随着LLM智能体日益胜任长程任务——评估其在经济系统中的表现日益重要。不同于主要评估单智能体与被动环境交互的既有基准——经济系统本质是多智能体的:要求自主智能体在长期内追求自身目标的同时沟通、谈判与交易。我们介绍CoffeeBench——评估LLM智能体在异构企业构成的长程多智能体经济中表现的基准。CoffeeBench中——两家农户、两家烘焙商与两家零售商在90天仿真中自主经营业务——每家经沟通与交易追求累计净收入最大化——同时管理现金、库存与定价。被评模型控制一家咖啡烘焙商——其余企业由固定参照智能体控制。跨多个近期开放权重与专有LLM——全部模型都超越不采取任何动作的被动基线——多数取得正净收入。智能体行为分析揭示长程经济交互的显著差异:表现更好的模型与其他企业沟通更活跃——而Claude Haiku 4.5展现“闲置漂移”失败模式——尽管产出连贯评估与计划——却反复选择不作为。我们发布代码与智能体轨迹以支持未来研究。

CoffeeBench:异构多智能体经济中长程LLM智能体基准:论文配图
图 1:CoffeeBench 概述。六名大语言模型代理人在 90 天的时间内在模拟咖啡供应链中经营公司,每个人都寻求最大化自己的累计净收入。在每次评估运行中,评估中的模型被分配一个咖啡烘焙商的角色,而其余公司则由固定的参考模型控制。