论文

MASCRDM:大语言模型训练过程中合规风险检测和缓解的多智能体系统

MASCRDM: Multi-Agent System for Compliance Risk Detection and Mitigation in Training Process of Large Language Models

AI 基础设施AI安全与内容治理基础设施

摘要

大语言模型(LLM)已应用于各个领域。然而,确保大语言模型的合规性和安全性,例如避免歧视和偏见,仍然是一个挑战。目前的工作主要集中在检测和过滤训练模型的输入和输出,而不是实时研究模型的内在架构。为了应对这一挑战,我们分析了大语言模型的训练过程,发现了两个关键问题:1)大多数现有方法的检测和过滤方法主要是静态的,仅实现局部优化,而没有系统地增强大语言模型的合规性。 2)现有方法的另一个问题是在整个训练过程中缺乏实时风险检测和缓解,这导致灵活性有限。受此启发,我们在大语言模型训练过程中提出了MASCRDM(合规风险检测和缓解多Agent系统)。首先,我们根据现有的人工智能(AI)法律制定了一套合规规则,并在合规法律专家的指导下制定了合规特定的大语言模型。然后,我们将LLM解构为多个组件,并根据合规知识图谱识别关键节点。在LLM培养过程中,我们全程实施多方Agent,为LLM开发者提供合规风险提示和建议。歧视和偏见基准实验表明,我们的多智能体系统可以有效提高合规性,同时保持合理的语义性能。结果表明,我们的方法为系统地降低大语言模型内部的合规风险提供了一条可执行路径。