论文
Fin-Bias:金融领域人类偏见下LLM决策的综合评估
Fin-Bias: Comprehensive Evaluation for LLM Decision-Making under human bias in Finance Domain
摘要
大语言模型 (LLM) 越来越多地部署在金融环境中,引发了人们对可靠性、一致性和对抗性操纵敏感性的严重担忧。虽然之前的金融相关基准评估了 LLM 在股票交易方面的能力,但它们通常仅限于小样本,并且无法证明 LLM 对具有潜在人为偏见的背景的敏感性。我们引入 Fin-Bias(长期且不确定的金融背景下的金融羊群效应),这是在面临不确定性和可能的人为偏见时评估 LLM 投资决策的基准。 Fin-Bias 包括 8868 篇针对公司的长篇分析师报告,其中包括由来自各个行业的投资评级(看涨/中性/看跌)的资深分析师总结和分析的公司方面。我们向 大语言模型 提供带有/不带分析师投资评级甚至“假”评级的公司分析师报告,以获得由 LLM 生成的投资评级。我们的结果表明,LLM 倾向于在上下文中聚集显性偏见。我们还开发了一种检测潜在人类意见的方法,这可以鼓励 LLM 独立思考,一些模型在预测未来股票回报方面甚至超过了人类的表现。