论文

从搜索到研究:探索自主定量因子挖掘中的搜索扩展

From Search to Research: Exploring Search Scaling in Autonomous Quantitative Factor Mining

模型推理测试时计算扩展

摘要

推理扩展已被证明可以提高大语言模型 (LLM) 的性能,并且这一原则通过增加搜索预算自然延伸到自主 LLM Agent,我们将其称为“搜索扩展”。尽管之前的工作已经描述了 LLM 推理扩展的机制、扩展行为和性能限制,但对于自主研究中的这些问题知之甚少。因此,我们使用基于金融研究报告的 50 个定量因素挖掘任务来研究搜索规模如何影响研究绩效,以及推动这些成果的机制是什么。每项任务都需要Agent执行端到端的研究循环,从解释假设并在代码中实现它,到评估和迭代地完善结果因素。在九个模型中,我们通过跟踪不同预算的性能、在模型之间转移中间研究状态以及比较不同的搜索策略,研究模型能力、搜索深度和搜索组织如何影响质量。我们发现(1)初始性能与模型能力的相关性更强,而更深层次的搜索可以缩小跨模型差距; (2)模型嫁接表明早期研究状态对最终性能有实质性影响; (3) 在相同迭代预算下,并行搜索优于顺序搜索,这与更广泛的搜索空间覆盖带来的好处一致。进一步的轨迹分析表明,性能较高的模型在选择候选者时可以更有效地诊断故障、修改搜索方向并保留预期的经济假设。这些发现表明,自主研究的未来进展将需要更强大的模型以及在整个研究过程中部署测试时计算的自适应策略。