论文
从知到行:面向LLM股票交易Agent的记忆受控基准
From Knowing to Doing: A Memory-Controlled Benchmark for LLM Trading Agents on Stock Markets
摘要
评估大语言模型(LLM)Agent能否在资本市场中获利,正越来越多地被构建为端到端交易:将Agent置于历史市场中,让其进行交易,并度量投资组合收益。这一设置容易受到两类评估失效的影响。其一,长回测往往与前沿LLM的知识截止日期重叠,使被记忆的股票代码、日期、价格和市场叙事得以替代投资推理。其二,原始收益是选股能力的噪声代理指标,因为正的业绩可能来自市场beta、风格暴露或有利的行情环境,而非真正的alpha。我们提出KTD-Fin(Knowing-To-Doing Financial Benchmark),一个同时解决这两个问题的端到端股票市场交易基准。KTD-Fin采用数据侧掩码协议,在提示词与工具之间一致地对关键标识符和日历信息进行匿名化,从而将历史市场记忆与投资决策分离。它还引入了Barra风格的业绩归因框架,将投资组合收益分解为市场、风格与选股alpha成分。在对十个前沿LLM Agent于2024至2026年区间中国沪深300上的评估中,掩码显著改变了Agent的决策理由,推动其转向基于匿名化因子的推理。归因分析进一步表明,在泄漏受控评估下,LLM Agent的累计收益在很大程度上可由被动的市场与风格暴露解释,持续选股alpha的证据有限。这些发现表明,金融LLM基准不仅应评估Agent是否赚钱,还应评估收益来源是否反映可迁移的投资技能。我们发布KTD-Fin,作为对LLM交易Agent进行泄漏受控与归因感知评估的可复现模板。
