论文

FinSafetyBench:评估真实金融场景中的 LLM 安全性

FinSafetyBench: Evaluating LLM Safety in Real-World Financial Scenarios

模型评测安全与风险评测

摘要

大语言模型(LLM)越来越多地应用于金融场景。然而,它们可能会产生有害的产出,包括促进非法活动或不道德行为,构成严重的合规风险。为了系统地评估 LLM 的金融安全性,我们提出了 FinSafetyBench,这是一种双语(英汉)红队基准,旨在测试 LLM 拒绝违反财务合规性的请求的情况。该基准以现实世界的金融犯罪案例和道德标准为基础,包括涵盖金融犯罪和道德违规的 14 个子类别。通过在三种代表性攻击设置下对通用和金融专用 LLM 进行大量实验,我们发现了允许对抗性提示绕过合规性保护措施的关键漏洞。进一步的分析揭示了中国环境下的更强的敏感性,并强调了针对复杂或隐性操纵策略的即时级防御的局限性。