论文

大语言模型金融智能评测:用LLM引擎对SuperInvesting AI进行基准测试

Evaluating Financial Intelligence in Large Language Models: Benchmarking SuperInvesting AI with LLM Engines

模型评测基准与评测资源

摘要

大语言模型正越来越多地用于金融分析与投资研究,但对其金融推理能力的系统评测仍然有限。在本工作中,我们提出AI金融智能基准(AFIB),一个多维评测框架,旨在从五个维度评估金融分析能力:事实准确性、分析完整性、数据时效性、模型一致性与失败模式。我们使用源自真实股票研究任务的95+道结构化金融分析题构成的数据集,评测五个AI系统:GPT、Gemini、Perplexity、Claude与SuperInvesting。结果揭示了各模型性能之间的显著差异。在该基准设置下,SuperInvesting取得最高的综合性能:平均事实准确性得分8.96/10,完整性得分56.65/70为最高,同时表现出受评系统中最低的幻觉率。诸如Perplexity等检索导向系统凭借实时信息获取在数据时效性任务上表现强劲,但分析综合能力与一致性较弱。总体而言,结果突出表明,大语言模型的金融智能本质上是多维的,将结构化金融数据访问与分析推理能力相结合的系统,能为复杂投资研究工作流提供最可靠的表现。

大语言模型金融智能评测:用LLM引擎对SuperInvesting AI进行基准测试:论文配图
Fig. 1: Overview of the AI Financial Intelligence Benchmark (AFIB) evaluation pipeline.财务分析查询是根据多部门数据集构建的,并跨多个人工智能模型执行。使用多维评分框架评估模型输出,捕获准确性、分析深度、完整性、新近度、一致性和故障模式。