论文
FinGuard:检测 LLM 交互中的金融监管违规行为
FinGuard: Detecting Financial Regulatory Non-Compliance in LLM Interactions
摘要
随着 大语言模型 (LLM) 越来越多地部署在金融服务中,单一的不合规交互可能会使机构面临监管处罚并直接损害消费者。现有的防护模型是围绕一般伤害分类法构建的,并忽略了基于特定金融法规的违规行为。我们通过直接根据监管文件运行的监管驱动管道来解决这一差距,引入财务合规风险分类法并综合扎根的训练数据,而无需任何预定义的违规类别。为了实例化中国金融监管管道,我们发布了 \textbf{FinGuard-Bench},据我们所知,这是金融监管合规性检测的第一个基准,在查询和响应级别都有专家注释的标签。我们进一步训练 \textbf{FinGuard},这是一种基于 Qwen3-8B 构建的财务合规检测模型,并通过监督 微调 和自我对弈强化学习对基于法规的数据进行训练。在 FinGuard-Bench 上,FinGuard 的性能明显优于所有基准,包括专用防护模型和更大的通用 LLM,例如 Qwen3.5-397B-A17B 和 GPT-5.1。此外,FinGuard 还保留一般安全功能,并仅使用政策文件来适应看不见的机构特定政策。我们将在 GitHub 上公开发布本工作中使用的代码、提示和资源。