论文

从数字到判断:欧洲上市不动产分析的专家型LLM智能体与强化学习

From Numbers to Judgment: Specialist LLM Agents and Reinforcement Learning for European Listed Real Estate

模型训练强化学习RLVRAgentic RL

摘要

我们研究金融分析中的局部化数值运算与综合性判断是否受益于同一种LLM专精化形式。Larix将16镜头的欧洲上市不动产分析框架映射到八个与镜头对齐的专家智能体;我们在保持模型、证据来源、任务指令、输出模式与评分固定的情况下,比较前沿LLM在单体提示与专家分解提示下的表现。在横跨七种监管架构的19家公司上,分解将数值类任务总分提高15.8个百分点,但并不能可靠提升判断类任务、甚至可能降低其表现,该模式在四次冻结模板派发中保持稳定;获得完整框架的单智能体对照无法复现数值增益。随后用GRPO以任务对齐的结构化奖励对Qwen3.5-9B进行后训练,将开发集得分提高12.0分、判断类总分提高14.2分,且在全部四个子上限任务上均有增益;增益迁移到未见公司(总体+15.2分;契约压力测试+40.4分)和未见监管架构(+4.3),在全部三个反记忆化切分上均为正向迁移。因此,提示词层面的分解改进模块化数值执行,而针对性的参数适配改进综合性金融判断。

从数字到判断:欧洲上市不动产分析的专家型LLM智能体与强化学习:论文配图
图1:Qwen3.5-9B 的 30 次 GRPO 更新运行中的训练奖励(蓝色,5 步滚动)与训练中开发集验证(红色,对唯一的任务–公司行去重),因预算限制提前停止。被保留的第 20 步检查点在整个过程中接受评估(第 4 节)。