论文

使用大语言模型进行值得信赖的收益电话会议记录分析的引文基准

A Citation-Grounded Benchmark for Trustworthy Earnings Call Transcript Analysis with Large Language Models

模型评测基准与评测资源

摘要

大语言模型 (LLM) 越来越多地用于财务文档分析,包括财报电话会议记录 (ECT)。除了生成独立的声明之外,用户越来越喜欢扎根的分析,将声明与源文档中可验证的引用配对,以实现独立验证。然而,评估此类分析声明通常需要大量的专家注释,成本高昂且难以扩展,而现实世界的财务分析通常涉及较长的上下文-问题-答案三元组,进一步增加了任务的复杂性。为了应对这些挑战并衡量大语言模型扎根分析的现状,我们提出了一种数字证据评估方法,该方法可以在不依赖专家注释的情况下进行扎根评估。我们还引入了自动化数据集构建流程,并从标准普尔 500 指数前 100 名成分股中构建了 ECTs-100,以支持基础性和正确性的基准。此外,我们还研究了有意识的无能,这是财务分析中的一种实际失败模式,大语言模型必须在现有证据不足时进行检测,并避免产生未经证实的幻觉。实证结果表明,大语言模型在基础性方面表现良好,但在正确性方面面临显着的限制,信息不足带来了额外的挑战。