论文
TraderBench:AI智能体在对抗性资本市场中有多稳健?
TraderBench: How Robust Are AI Agents in Adversarial Capital Markets?
摘要
评估金融领域的AI智能体面临两个关键挑战:静态基准需要昂贵的专家标注,却错失真实交易的核心——动态决策;而基于LLM的评判者在领域特定任务上引入不受控的方差。我们推出TraderBench,一个同时解决这两个问题的基准。它把经专家验证的静态任务(知识检索、分析推理)与对抗性交易模拟相结合,后者纯粹以已实现的表现计分——夏普比率、收益率与回撤——完全消除评判者方差。该框架设有两条新赛道:带有四种渐进式市场操纵变换的加密货币交易,以及横跨盈亏准确度、希腊字母与风险管理的期权衍生品计分。交易场景可用新市场数据刷新,以防止基准污染。我们在约50个任务上评估13个模型(从8B开源到前沿模型),发现:(1)13个模型中有8个在加密货币上得分约33,且在不同对抗条件下变化不到1分,暴露出固定、非自适应的策略;(2)扩展思考有助于检索(+26分),但对交易毫无影响(加密货币+0.3,期权-0.1)。这些发现表明当前智能体缺乏真正的市场适应能力,凸显了在金融领域开展基于表现的评估的必要性。