论文

ERTS:经文本语义扰动的伦理AI对抗鲁棒性测试

ERTS: Adversarial Robustness Testing of Ethical AI via Semantic Perturbation in a Bounded Consequence Space

模型评测鲁棒性、公平性与可信度评测

摘要

由于人工智能系统被部署在医疗保健分诊、自动驾驶车辆控制和就业筛选等高风险道德环境中,因此评估其针对道德推理的对抗性操纵的鲁棒性的正式方法仍然不发达。本文介绍了道德稳健性测试系统(ERTS),这是一个封闭管道框架:(1)将道德困境编码到基于既定道德理论的 22 维道德后果空间(ECS)中; (2) 应用 17 个语义扰动函数,服从 6 个有效性约束类,包括一个新颖的语义连贯性约束; (3) 通过 4 部分道德不稳定指数 (EII) 衡量决策偏差; (4) 生成域自适应部署前稳健性评估结论。我们在跨越 8 个部署领域的 50 个道德场景中评估了 4 个结构化基线模型和 2 个生产 LLM(Gemini 2.0 Flash 和 Llama 3.2),生成了 1,500 个对抗性测试用例。结果表明,只有 33% 的模型获得了评估许可,本地 Llama-3.2 模型被证明特别容易受到公平腐败和信息退化攻击 (ERS = 0.737)。据我们所知,没有任何现有框架将有限的道德后果空间、语义一致性约束和领域自适应评估结合在单个对抗性测试管道中。