论文
增强智能体安全判断:受控基准改写与类比推理应对欺骗性分布外场景
Enhancing Agent Safety Judgment: Controlled Benchmark Rewriting and Analogical Reasoning for Deceptive Out-of-Distribution Scenarios
摘要
由LLM驱动的工具使用智能体系统日益部署于网页、应用、操作系统与交易环境。但现有安全基准仍强调显性风险,可能高估模型判断欺骗性或模糊轨迹的能力。为填补缺口,我们提出ROME(Red-team Orchestrated Multi-agent Evolution):一个受控基准构建流水线,把已知不安全轨迹改写为更具欺骗性的评估实例,同时保留其底层风险标签。从100条不安全源轨迹出发,ROME产出300个挑战实例,覆盖上下文模糊、隐性风险与捷径决策。实验显示这些挑战集大幅降低安全判断性能,隐性风险用例即便对近期前沿模型也依然棘手。我们进一步研究ARISE(Analogical Reasoning for Inference-time Safety Enhancement):检索引导的推理时增强,从外部类比库检索ReAct式类比安全轨迹并作为结构化推理示例注入。ARISE无需重训即提升判断质量,但应视为任务特定的鲁棒性增强而非独立的安全保证。ROME与ARISE共同为欺骗性分布偏移下的智能体安全判断提供压力测试与改进的实用工具。
