论文

AlphaDiverse:后训练本地量化研究Agent以实现Alpha因子挖掘的多样性探索

AlphaDiverse: Post-Training Local Quantitative Research Agents for Diverse Exploration in Alpha Factor Mining

模型训练强化学习Agentic RL

摘要

基于大语言模型(LLM)的多Agent系统可以自动化Alpha因子挖掘,但其对外部API的依赖限制了对成本、可用性与机密性的控制。漫长的科研循环也倾向于重复少数成功的经济机制,导致研究路径塌缩。为解决这些局限,我们提出AlphaDiverse,一个集多Agent Alpha研究系统、多样性研究路径收集与本地Agent后训练于一体的框架。我们让研究系统生成互补的方案组合,并在各循环间变换研究环境,以收集多样的研究路径。利用这些多样的轨迹,我们以监督微调热启动本地的Planner与Realizer Agent。随后,我们提出一种联合GRPO方法,使用预测质量与贡献多样性对二者进行优化。研究反馈仅限于内部期数据,而冻结的最终模型在更晚的外部期数据上评测,从而避免测试集调优。在四个中国股票池上的实验表明,AlphaDiverse能够兼具竞争力的预测与更广泛的探索。

AlphaDiverse:后训练本地量化研究Agent以实现Alpha因子挖掘的多样性探索:论文配图
图 1:所提出的 AlphaDiverse 框架示意图。基于 API 的研究循环产生多样化的计划、因子实现与评估反馈。我们挑选高质量且互补的轨迹,对本地 Planner 与 Realizer 智能体进行热启动,再用 GRPO 联合精调。训练后的节点将替代对应的 API 节点,实现本地可控的 Alpha 因子研究。