论文
延迟满足作为长程LLM的多智能体生存微基准:社会暴露、人格与工具使用预算
Delay-of-Gratification as a Multi-Agent Survival Micro-benchmark for Long-Horizon LLMs: Social Exposure, Personas, and Tool Use Budgets
摘要
大型语言模型(LLM)日益被部署为必须在长时交互中维持目标、使用工具并适应其他智能体的多轮智能体。然而,现有研究缺乏可审计、多轮、多因子的实验来量化LLM在显式约束下的行为,并给出揭示行为如何随长时程展开的时间分辨统计。为填补这一空白,我们开发了一个受斯坦福棉花糖实验启发的多智能体微基准:ReAct智能体按分钟运行,在每步预算下使用提出问题工具,同时我们全因子操纵社会情境(广播vs隔离)、人格(年龄、享乐驱动)和元认知策略(强制vs可选工具使用)。我们用Kaplan-Meier(KM)生存曲线和离散时间风险模型,对64个单元格中19,200条智能体轨迹的长时间风险期进行分析。行为呈现早期急剧的吃掉冲动,只有75.9%的智能体坚持到最后。在离散时间风险模型中,隔离相对广播降低了每分钟风险,而强制自我提问策略增加风险。智能体平均提问约7.12次,并在约6%的分钟数内触及每步预算。广播下提问的衰减快于隔离。消融实验表明,去除享乐驱动和/或人格年龄会提高生存与完成率、缩小广播/隔离差距,但强制与可选的排序保持不变。组合消融(无享乐+无人格年龄)产生最高完成率(接近1.0)。这些结果确立了延迟满足作为一个紧凑的多轮交互基准,能够捕捉LLM智能体中的社会传染和工具使用动态,为分析长时程、多智能体行为提供了可复现测试床和统计方法。
