论文
大语言模型在欺诈检测与抵御动机性投资者施压方面优于人类
Large Language Models Outperform Humans in Fraud Detection and Resistance to Motivated Investor Pressure
摘要
经人类反馈训练的大语言模型在投资者带着已被说服的判断前来咨询欺诈性机会时,可能会压制欺诈警告。我们在一项预注册实验中检验了这一假设,涵盖七个主流LLM与十二个投资场景(覆盖合法、高风险与客观上属欺诈的机会),将3,360场AI咨询对话与1,201名参与者构成的人类基准相结合。与预测相反,动机性投资者话术并未压制AI的欺诈警告;若说有影响,反而略微增加了警告。背书反转在每1,000次观察中少于3例。人类顾问在基线水平上对欺诈投资的背书率为13-14%,而所有LLM均为0%;人类在压力下压制警告的比率是AI的两到四倍。在相同的顾问角色下,AI系统目前比普通人类提供更一致的欺诈警告。