论文
Backtrader-Bench:使用自行生成的 MCQ 对 LLM 代理的算法交易进行基准测试
Backtrader-Bench: Benchmarking LLM Agents on Algorithmic Trading with Self-Generated MCQs
摘要
在算法交易中评估 LLM 编码智能体 很困难,因为静态基准测试存在数据污染风险,而数字回测输出需要实际代码执行中的 真值。我们推出 Backtrader-Bench,这是一个具有两个互补管道的框架。确定性多项选择问题 (MCQ) 管道根据五种交易策略、33 个模板和三个难度级别的回测配置生成问题,并由一个独立的检查器重新得出每个答案。生成器-求解器过滤管道自动挖掘更难的问题:生成器编写由可执行代码验证的问题,将其转换为 MCQ,并丢弃任何无需工具求解器无需执行代码即可回答的问题。我们在包含 30 个问题的精选集上评估了 11 个不带工具的模型(每个运行 10 次)和 4 个带工具的配置。工具增强代理在一次通过中达到 90.0% 的准确率(GPT-5.5 和 Opus 4.7),比最好的无工具基线(73.0%,10 次运行的平均值)高出 17 个百分点。在 38 个单独挖掘的问题上,无工具准确率进一步下降,一半模型降至大致随机机会水平 (25%)。除了评估之外,可扩展的 MCQ 基础设施还旨在生成强化学习的训练语料库,最终目标是为量化交易工作流程构建专门的代理。