论文
一位分析师不是 真值:根据观察到的专业实践对代理构建的财务模型进行评级
One Analyst Is Not Ground Truth: Grading Agent-Built Financial Models Against Observed Professional Practice
摘要
语言模型代理现在可以构建完整的财务模型,但仍不清楚他们是否已经学会了赋予这些模型意义的财务判断。现有的基准通常将正确性锚定在专家编写的解决方案(例如数字目标或详细的规则)上,这引入了一个隐含的假设:\emph{一个专家解决方案可以充当 真值。} 当财务提供唯一的答案时,这是合适的,但在需要判断时则不合适。来自专业实践的证据挑战了这一假设:当不同分析师为同一家公司构建的财务模型相互进行评分时,在标准容差下,中位数分数仅为 0.33,\emph{揭示单参考评分将专业分歧与错误混为一谈。}因此,我们引入了 GAUGE,这是一种将财务模型评估分解为确定性检查、评分标准判断和数值规则的基准。 GAUGE 基于涵盖 922 家公司和所有 25 个 GICS 行业集团的 1,001 项专业评估,确定性地检查机械性能,并根据专业实践的范围评估具有判断力的数量。然后,我们通过测试专业知识排序、坚持的专业价值观以及 LM 判断的稳健性来验证 GAUGE 作为测量工具的作用。我们的研究结果表明,当前的 LM 代理在构建财务模型方面比在推导驱动估值的公司特定假设方面要好得多,这种差距甚至在 微调 之后仍然存在。