论文
QuantCode-Bench:评估 大语言模型 生成可执行算法交易策略能力的基准
QuantCode-Bench: A Benchmark for Evaluating the Ability of Large Language Models to Generate Executable Algorithmic Trading Strategies
摘要
大语言模型 在通用编程任务上表现出了强大的性能,但其生成可执行算法交易策略的能力仍未得到充分开发。与标准代码基准不同,交易策略生成需要同时掌握特定领域的金融逻辑、专业 API 的知识,以及生成不仅语法正确而且能够根据历史数据进行实际交易的代码的能力。在这项工作中,我们提出了 QuantCode-Bench,这是系统评估现代 LLM 从英文文本描述生成 Backtrader 框架策略的基准。该基准测试包含从 Reddit、TradingView、StackExchange、GitHub 和综合来源收集的 400 个不同难度的任务。评估是通过多阶段管道进行的,该管道使用 LLM 判断器检查语法正确性、成功的回测执行、交易的存在以及与任务描述的语义一致性。我们在两种设置中比较最先进的模型:单轮,必须在第一次尝试时正确生成策略,以及代理多轮,其中模型接收迭代反馈并可以修复其错误。我们分析了管道不同阶段的故障模式,并表明当前模型的主要局限性与语法无关,而是与交易逻辑的正确操作、正确的 API 使用以及对任务语义的遵守有关。这些发现表明,交易策略生成构成了一类独特的特定领域代码生成任务,其中的成功不仅需要技术正确性,还需要自然语言描述、财务逻辑和数据策略的可观察行为之间的一致性。