论文

SysTradeBench:具有漂移感知诊断功能的策略到代码交易系统的迭代构建-测试-补丁基准

SysTradeBench: An Iterative Build-Test-Patch Benchmark for Strategy-to-Code Trading Systems with Drift-Aware Diagnostics

模型评测基准与评测资源

摘要

大语言模型 (LLM) 越来越多地用作定量研究副驾驶,将自然语言策略规范转换为可执行的交易代码。然而,大多数现有的评估要么侧重于静态金融知识,要么用单一盈利指标来总结绩效,从而在将策略到代码交易系统作为受监管、可审计的软件进行基准测试方面存在差距。我们推出了 SysTradeBench (SysTB),这是一种迭代构建-测试-补丁基准,可在漂移感知诊断下评估 LLM 生成的交易系统。给定标准化的基本策略文档和冻结语义,每个模型必须生成 (i) 策略卡、(ii) 可执行代码和 (iii) 强制审核日志。沙盒Harness运行确定性和防泄漏检查,检测迭代中的规则漂移,并返回证据包以支持受限补丁。 SysTradeBench 报告规范保真度、风险纪律、可靠性、样本外稳健性指标以及成本效益信号的多维记分卡。我们评估了 12 个策略中的 17 个模型。顶级模型的有效性高达 91.7% 以上,综合得分很高,但证据驱动的迭代也通过 Iter2 诱导代码收敛。这些发现表明,LLM 迭代补充而不是取代人类定量研究人员治理:LLM 擅长快速原型设计和浅层错误修复,而人类监督对于需要解决方案多样性和整体稳健性的关键策略仍然至关重要。