论文

RAIL Guard:弥合LLM智能体负责任AI的评估到修复鸿沟

RAIL Guard: Closing the Evaluation-to-Remediation Gap in Responsible AI for LLM Agents

智能体系统Agent 动作执行与治理

摘要

现有的大语言模型智能体护栏系统以二分类器方式运行、封锁不安全内容,组织只能丢弃失败输出并从头重试。我们提出RAIL Guard,一个闭环负责任AI管线:在八个可测维度上评估LLM输出,并经“评估—重写—再评估”循环迭代修复失败输出。我们在四个前沿LLM、4,276个内容输出与6,400个智能体工具调用场景上开展三组实验。闭环修复达到96.9%收敛率,对比封锁重试的49.1%,但收敛率最高的方法使效用下降22.3%;反馈驱动的自修复在可修复维度上达86.6%收敛且无显著效用损失(p=0.177)。工具调用前评估把不安全智能体执行减少33%(p=0.007),对任务完成零影响。我们识别出可修复维度与结构性维度的关键区别——透明性(93.0%)、可问责性(92.8%)与包容性(82.5%)失败——后者需要架构性而非算法性方案。系统以开源SDK提供。

RAIL Guard:弥合LLM智能体负责任AI的评估到修复鸿沟:论文配图
图 1:四种前沿模型的 RAIL 总体得分分布。红色虚线表示 7.0 阈值。 Gemini 2.5 Flash 集群紧密高于阈值,而 GPT-5.2 显示出更广泛的分布,并有大量左尾。所有输出的 10.0%(4,276 中的 426)低于阈值。