论文
大语言模型金融智能评测:用LLM引擎对SuperInvesting AI进行基准测试
Evaluating Financial Intelligence in Large Language Models: Benchmarking SuperInvesting AI with LLM Engines
摘要
大语言模型正越来越多地用于金融分析与投资研究,但对其金融推理能力的系统评测仍然有限。在本工作中,我们提出AI金融智能基准(AFIB),一个多维评测框架,旨在从五个维度评估金融分析能力:事实准确性、分析完整性、数据时效性、模型一致性与失败模式。我们使用源自真实股票研究任务的95+道结构化金融分析题构成的数据集,评测五个AI系统:GPT、Gemini、Perplexity、Claude与SuperInvesting。结果揭示了各模型性能之间的显著差异。在该基准设置下,SuperInvesting取得最高的综合性能:平均事实准确性得分8.96/10,完整性得分56.65/70为最高,同时表现出受评系统中最低的幻觉率。诸如Perplexity等检索导向系统凭借实时信息获取在数据时效性任务上表现强劲,但分析综合能力与一致性较弱。总体而言,结果突出表明,大语言模型的金融智能本质上是多维的,将结构化金融数据访问与分析推理能力相结合的系统,能为复杂投资研究工作流提供最可靠的表现。
