论文
AlphaDiverse:后训练本地量化研究Agent以实现Alpha因子挖掘的多样性探索
AlphaDiverse: Post-Training Local Quantitative Research Agents for Diverse Exploration in Alpha Factor Mining
摘要
基于大语言模型(LLM)的多Agent系统可以自动化Alpha因子挖掘,但其对外部API的依赖限制了对成本、可用性与机密性的控制。漫长的科研循环也倾向于重复少数成功的经济机制,导致研究路径塌缩。为解决这些局限,我们提出AlphaDiverse,一个集多Agent Alpha研究系统、多样性研究路径收集与本地Agent后训练于一体的框架。我们让研究系统生成互补的方案组合,并在各循环间变换研究环境,以收集多样的研究路径。利用这些多样的轨迹,我们以监督微调热启动本地的Planner与Realizer Agent。随后,我们提出一种联合GRPO方法,使用预测质量与贡献多样性对二者进行优化。研究反馈仅限于内部期数据,而冻结的最终模型在更晚的外部期数据上评测,从而避免测试集调优。在四个中国股票池上的实验表明,AlphaDiverse能够兼具竞争力的预测与更广泛的探索。
