论文
MintEval:LLM实现的是你要求的交易策略吗?
MintEval: Do LLMs Implement the Trading Strategy You Asked For? A Behavioural-Equivalence Benchmark for Natural-Language-to-Strategy Code
摘要
大语言模型正从产出交易信号转向编写执行它们的代码。第二种角色的失败模式是静默的:生成代码能跑、回测能画图,但交易员描述的风险逻辑并非被执行的逻辑。既有代码基准测单元测试上的功能正确性、金融基准测预测,都不度量实现是否表现得像被要求的策略。我们提出MintEval:参照策略由可组合构件库程序化生成、反译为口语化交易员指令、再由受测模型重新实现;生成与参照程序在相同市场数据与摩擦下逐bar执行,按动作而非代码相似度或利润比较——alpha被差分掉。MintEval v0含BTCUSDT 15分钟数据的800个任务,按与描述长度解耦的执行测得状态跨度复杂度tau分层。低成本模型平均ActionMatch至多0.544、精确复现至多0.087;在200任务分层子集上前沿模型(Claude Opus 5.5)达0.889、精确复现0.575,但仍有27.5%任务静默失败。给定构件菜单时模型几乎完美识别策略,然而规范被正确读取的实现中79.2%在超过10%的活跃bar上发散。近期策略生成基准的LLM裁判原样应用时接受了所有这些静默失败。