论文
Yuvion LLM:针对内容和 AI 安全的具有对抗意识的 大语言模型
Yuvion LLM: An Adversarially-Aware Large Language Model for Content And AI Safety
摘要
随着 大语言模型 越来越多地部署在现实世界的系统中,安全故障仍然可能导致有害的输出和危险的误用。我们认为,安全的本质是对抗性的:许多失败不仅仅源于自然投入,还源于逃避模型政策和保障措施的战略尝试。然而,现有的通用模型开发在很大程度上忽视了这种对抗性,并且通常不足以满足涉及规划、工具使用和多步骤推理的现实安全场景,导致测量的安全性能高估了实际部署的稳健性。为了解决这一差距,我们推出了 Yuvion LLM,这是一款专为对抗性强大的内容安全和更广泛的人工智能安全而构建的 大语言模型。 Yuvion LLM 将对抗稳健性和代理能力视为一流目标。其管道结合了对抗感知数据构建、知识增强的持续预训练和基于策略的多任务安全后训练,包括风险感知监督微调和基于强化学习的策略优化,以及复杂安全场景中工具使用和多步骤推理的安全感知代理强化学习。我们进一步介绍了 Yuvion LLM RiskEval (YLRE),它是跨越四个评估类别的 93 个基准的集合,涵盖各种开放和内部评估,重点关注安全性、对抗鲁棒性和现实世界的能力要求。在这些评估中,Yuvion LLM 在以安全为中心的基准测试中表现出明显的优势,并且在对抗条件下具有特别强的鲁棒性,同时保持了坚实的整体能力。值得注意的是,Yuvion-8B 在多项安全任务上的表现优于大多数最先进的基准,包括 GPT-5.4 和 Qwen3-MAX 等更大的模型。