论文

基于 LLM 的事件预测的强化学习

Reinforcement Learning for LLM-based Event Forecasting

模型训练强化学习

摘要

我们使用组相对策略优化 (GRPO),这是一种最近设计的样本和记忆有效的强化学习方法,在 1.5B 到 14B 参数范围内微调预训练的 LLM,并能够通过使用维基百科修订工具或新闻摘要来获取当前信息,以预测超出 LLM 知识截止的真实事件,以及模拟动态的不同方面的问题那个训练。我们使用这些实验的结果来评论 LLM 的预测扩展能力,并考虑预测未来事件(例如掷骰子)时固有的任意不确定性的影响,对判断性预测如何适应可验证/不可验证的领域分类进行分类。通过 GRPO 训练,我们成功地将 1.5B 参数 Transformer (Qwen 2.5 1.5B) 在相同数据集上的预测性能优于 Claude Sonnet 3.5(通过市场商定概率的交叉熵进行测量)。我们还讨论了实现这一结果的道路上的各种死胡同。