论文
自己做研究:通过学习搜索来学习预测
Do Your Own Research: Learning to Forecast by Learning to Search
摘要
基于结果的强化学习可以训练语言模型来预测现实世界的事件,但之前的预测工作要么在训练前冻结研究背景,要么仅在测试时部署 Agentic 研究,因此收集证据的技能永远不会受到奖励的影响。我们引入了一个 Agentic 预测环境、数据集和利用 2,100 多个已解决的 Polymarket 问题构建的工具;Agent在rollout时获取自己的上下文(网络搜索、页面阅读和金融时间序列,所有这些都受到对每个问题截止之前发布的信息的分层泄漏过滤的限制),并且我们在 Brier 分数奖励下使用单周期 GRPO 对其进行训练 Qwen3.5-35B-A3B(3B 活动参数)。训练改变了智能体与信息交互的方式:校准提高了 30-40%,随着证据规则的学习,每次部署的搜索尝试次数从 3.8 次下降到 2.25 次。在相同的工具中针对四个前沿模型进行评估,经过训练的策略还领先于基于证据的预测测试的每个前沿模型,包括 Claude Opus 4.5(软 Brier 0.254 与 0.256,n=265),推理成本约为 5%,并且在最困难的问题上,其差距最大,这些问题是群众本身尚未决定的。我们将环境、数据集和每次部署记录发布为时间预测Agent的可重用工具。