论文
用于生成财务建议的 GRPO:在 CATE 评估中优于商业 LLM
GRPO for Financial Advice Generation: Outperforming Commercial LLMs under CATE Evaluation
摘要
从业务记录中生成可行的财务建议需要模型集成数字推理、领域知识和合理的判断,同时避免可能损害业务的建议。直接监督很困难:历史决策不一定是最优的,并且获得高质量的自由格式标签的成本很高。我们将财务建议生成制定为强化学习问题,并使用组相对策略优化(GRPO)微调开放权重语言模型。我们的奖励是 LLM 作为法官的评分标准,该评分标准在建议质量的多个二元维度上对每个建议进行评分,并通过预防伤害的安全门进行了增强。由于仅基于 LLM 的评估无法确认改进是否反映了真正的商业价值而不是适应法官,因此我们通过基于标准双稳健条件平均治疗效果 (CATE) 估计器的独立于法官的审计对其进行补充。根据这次观察性 离策略 审计,我们训练有素的 LLM 实现的毛利润提升约为最强评估商业基准的两倍(0.0228 美元 vs.\ 0.0104 美元),以及任何评估的保单中最低的下行利率和最小的负尾部风险。值得注意的是,这两项评估对基线的排名并不相同:未经训练的基础模型在法官评分标准上排名最后,但在因果审计上排名第二,这表明审计捕获了法官没有捕获的信号。我们的结果表明,具有基于金融的奖励信号的 GRPO 可以产生比商业 LLM 更有用的商业建议,并且独立于法官的因果审计是对金融 NLP 中 LLM 作为法官评估的有价值的补充,而不是确认。