论文
递归推理还是统计外推?多智能体相互依赖决策中的上下文学习
Recursive Reasoning or Statistical Extrapolation? In-Context Learning in Multi-Agent Interdependent Decision-Making
摘要
上下文学习使大语言模型智能体利用交互历史改善决策,但这种改善究竟反映内部推理优化,还是仅仅外推统计模式,仍不清楚。为区分二者,我们研究需要递归信念推理的多智能体不完全信息博弈。通过构建公共物品博弈并操纵历史反馈的统计结构,我们以独立于历史的理性预期均衡REE基准评估决策质量。实验发现,历史统计模式受到扰动时,较长上下文的好处基本消失,决策质量退化到无上下文基线,且更强的战略相互依赖显著放大这种退化。结果提示,在这类战略环境中,上下文学习行为更符合统计外推而非战略推理。本文将上下文学习的机制研究扩展到战略多智能体环境,引入REE作为区分推理与外推的诊断工具,并提供可复用框架,以探查大语言模型在递归信念任务中的推理边界。
