论文
Conv-FinRe:面向效用锚定金融推荐的对话式纵向基准
Conv-FinRe: A Conversational and Longitudinal Benchmark for Utility-Grounded Financial Recommendation
摘要
大多数推荐基准评估模型模仿用户行为的能力。但在金融咨询中,市场波动下的观察行为可能有噪声或短视,并可能与用户长期目标冲突。因此,把用户的选择当作唯一真值,会把行为模仿与决策质量混为一谈。我们提出 Conv-FinRe,一个对话式、纵向的股票推荐基准,超越行为匹配评估 LLM。给定入门访谈、分步市场情境和咨询对话,模型须在固定投资期限内生成排名。关键是,Conv-FinRe 提供多视角参照,把描述性行为与基于投资者特定风险偏好的规范效用区分开,从而诊断 LLM 究竟遵循理性分析、模仿用户噪声,还是被市场动量驱动。基准由真实市场数据和人类决策轨迹构建,实例化受控咨询对话,并评估一组最先进 LLM。结果显示理性决策质量与行为对齐之间存在持续张力:基于效用的排名表现好的模型常难以匹配用户选择,而行为对齐的模型可能过拟合短期噪声。数据集已在 Hugging Face 公开发布,代码库见 GitHub。
