论文

BacktestBench:自动化量化策略回测的基准 大语言模型

BacktestBench: Benchmarking Large Language Models for Automated Quantitative Strategy Backtesting

模型评测基准与评测资源

摘要

定量回测对于评估交易策略至关重要,但仍然受到高技术壁垒和有限的可扩展性的阻碍。虽然 大语言模型 (LLM) 提供了一条通过先进的代码生成、工具使用和代理规划来自动化这一复杂的跨学科工作流程的变革性路径,但由于目前缺乏专门用于自动化定量回测的大规模基准,实际实现受到了巨大挑战,这阻碍了该领域的进展。为了弥补这一关键差距,我们引入了 BacktestBench,这是第一个用于自动定量回测的大规模基准。它以超过 600 万条真实市场记录为基础,包含 18,246 个精心注释的问答对,涵盖四个任务类别:指标计算、股票选择、策略选择和参数确认。我们还提出了 AutoBacktest,一个强大的多代理基线,通过协调用于语义因素提取的 Summarizer、用于验证 SQL 生成的 检索器 以及用于 Python 回测实现的 Coder,将自然语言策略转换为可重复的回测。我们对 23 个主流 LLM 进行评估,并辅以有针对性的消融,确定了影响端到端性能的关键因素,并强调了扎根验证和标准化指标表示的重要性。