论文
只提议、不裁决:面向挖掘投资因子的LLM Agent的任意时刻有效裁判
Propose, Don't Judge: An Anytime-Valid Referee for LLM Agents That Mine Investment Factors
摘要
语言模型Agent如今包办了量化因子研究的全过程:提出投资因子、回测、筛选幸存者并将其退役。我们要问的是,其中哪些工作应当留给Agent。我们的答案是受治理的自我进化:Agent可以提议,而一个Agent无法触碰的冻结统计裁判必须进行裁决。裁判只依据提交之后揭示的市场结果为每个候选打分——通过下注的方式进行——因此其错误发现保证对任意提议策略在任何停止时刻都成立。我们在一个植入真值的合成世界、一个探针编写环境以及中证500的十年滚动回测中,把三个提议者(脚本、老虎机和语言模型)与该裁判及三个故意泄漏的裁判交叉组合。谁来裁决决定了错误准入的数量:在脚本提议者下,冻结裁判准入的低于阈值因子比泄漏裁判少5—11倍,且没有任何提议者能弥合这一差距。谁来提议决定了产出:语言模型胜过脚本、与老虎机相当,并增加了老虎机所缺乏的一项能力——编写自己的诊断探针。证书的代价是时间:一个被准入的真因子要等待约500个交易日,因此经认证组合的夏普比率落后于无门控版本。裁决属于程序;提议与造仪器属于Agent。