论文

经多层级智能体数据整理的自动困难样本合成

Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation

模型训练合成数据

摘要

多模态大语言模型(MLLM)日益部署于细腻的内容安全与审核任务,但它们对对抗攻击与分布外边缘案例仍然脆弱。传统的主动学习与人工标注无法在新型多模态威胁的复杂性与体量上扩展。本文提出自动化、智能体的红队框架:以迭代策略系统性合成困难样本——既提出新颖假设,也在既往尝试上变异。利用由高推理架构师智能体、先进图像生成器、以及LLM评分员组成的多层级验证委员会构成的多智能体架构:我们的系统在无任何人工干预下自主发现挑战边界的违规与含糊的政策边缘案例。通过测试时检索把这些精心合成的对抗样本用作上下文内示范:我们实质提升目标模型的鲁棒性——在公开图像安全基准上把假阴性率从41.2%降到24.5%,且不依赖任何人工标注。

经多层级智能体数据整理的自动困难样本合成:论文配图
图 1:多代理红队框架概述,说明了架构师、运营商和 LLM 评估者委员会之间的交互,以系统地发现政策违规和边界示例。