论文

为何更强大的模型可能带来更危险的系统:来自金融市场的LLM智能体实证研究

Why Better Models Can Create Riskier Systems: Evidence from LLM Agents in Financial Markets

智能体系统Agent任务评测

摘要

大语言模型(LLMs)正在被大规模部署于具有重大影响的现实系统中,如金融市场、内容审核和招聘。我们发现,提升单个模型能力可能反而损害系统级结果,而非改善。我们假设,共享训练和架构会导致更强大的LLM智能体行为更趋同,产生相关性动作而无法实现去风险化。我们构建了一个通用框架,揭示这种相关性如何导致不可分散的风险底限,并通过一个基于智能体的金融市场模拟实验,使用不同通用能力的LLM交易智能体验证该框架的预测。结果表明:(1)前沿LLM表现出显著相关行为,且随能力提升而增强;(2)当其共享推理准确时,增加智能体参与可降低市场整体风险;(3)当智能体共享同一错误信息环境时,这种相关行为反而成为系统性风险。上述结果揭示了一个能力悖论:提升单个模型能力并不必然带来更优的系统级结果。该动态是否在其他领域存在,仍需进一步实证检验。

为何更强大的模型可能带来更危险的系统:来自金融市场的LLM智能体实证研究:论文配图
图 1:系统状态 StS_{t}(红色)跟踪地面实况 FF(虚线),在 t=40t=40 时从 100 变为 120,在 t=80t=80 时变为 90。阴影区域显示跟踪误差。跨智能体的相关非纠正行为会阻止 StS_{t} 收敛到 FF,从而产生聚合错误的持久下限。