论文

评估人工智能时代的金融情绪

Evaluating Financial Sentiment in the Age of AI

模型评测模型能力评测

摘要

金融情绪指标广泛应用于实证金融领域,但目前尚不清楚通用大型语言模型(LLM)是否能改进现有的金融特定方法。本文使用两个标准:语言有效性和经济有效性,评估了 12 种情感模型,包括基于字典的方法、金融专用转换器和开源大语言模型。我们发现,通用 LLM 的分类性能可与金融专用Transformer模型相媲美,而无需针对特定任务进行微调。然而,更高的分类准确度并不意味着更强的经济关系。一些模型产生的情绪指标与盈利意外显着相关,但没有一个模型与次日股票收益显着相关。对于收益大幅超出或低于预期的公告,模型表现最为强劲;而对于收益意外较为温和的公告,模型表现则大幅减弱。这些发现表明,金融情绪捕捉了有关企业经济表现的信息,但解释短期市场反应的能力有限