论文
MM-FinEval:现实世界金融预测的多任务多模态基准
MM-FinEval: A Multi-Task Multimodal Benchmark for Real-World Financial Forecasting
摘要
收益电话会议的财务预测需要模型对复杂的公司披露、市场预期和微妙的沟通信号进行推理。然而,现有的财务基准通常仅限于单模态输入或单任务设置,因此很难评估多模态大语言模型(LLM)是否可以支持现实世界的财务分析。在本文中,我们介绍了 MM-FinEval,这是一种新颖的基准,旨在评估跨多个金融任务的多模态大语言模型。 MM-FinEval 跨越了从 2019 年到 2022 年的不同时间线。整个提议的数据集包含 2,045 个 S\&P 500 财报电话会议作为输入,12 个财务任务标签作为输出。每个输入包含三种模式:电话会议的逐字文本记录、电话会议期间使用的相应演示幻灯片以及整个录音。为了建立严格的评估框架,我们分析了三个不同模型类别的 19 个基线模型:图像-文本、音频-文本和任意到任意配置。我们观察到,即使与仅限于两种模态输入的较大专有模型相比,处理所有三种模态的小型 Any-to-Any 模型也能实现强大的性能。这表明我们的三模态数据集设计引入了有用的、非冗余的信息。这些结果验证了文本、音频和视觉数据可以作为重要的补充信号,模仿人类分析专家的决策过程。