论文

金融时间序列咨询的事后偏好优化

Hindsight Preference Optimization for Financial Time Series Advisory

模型训练偏好优化

摘要

时间序列模型预测数字;决策者需要咨询——带有推理的方向性信号、可行的建议和风险管理。训练此类预测咨询的语言模型面临着一个根本挑战:质量取决于预测时未知的结果。我们将强化学习中的两个想法结合起来——使用执行过程中不可用的信息来回顾性地生成训练信号和偏好对齐——并提出后见之明偏好优化:观察到的结果让 LLM 判断标量指标无法捕获的维度上的候选建议排名,无需人工注释即可为 DPO 生成偏好对。我们将其应用于标准普尔 500 股票时间序列上基于视觉语言模型的预测咨询,4B 模型在准确性和咨询质量方面均优于其 235B 模型,证明了这一点。