论文

HASTE稀疏证据Harness进化

HASTE: Evolving Agent Harnesses Against Emerging Attacks Using Sparse Evidence

智能体系统Agent 动作执行与治理智能体自我改进

摘要

智能体Harness通过强制安全约束防止不安全动作,在防御中作用关键。但快速涌现的攻击快于人工Harness适配,这促使自动Harness进化。可用于进化的信号往往稀疏,例如威胁报告与预印本中的简短描述或少量攻击示例。为此我们提出HASTE,一个多智能体框架,通过安全规格生成与攻击案例生成之间的对抗互动,从稀疏威胁证据进化智能体Harness。安全规格引导Harness更新指向已识别的安全漏洞,攻击案例则在每次更新后探测残余漏洞。把评估结果回馈到两个过程,使HASTE能针对超出最初观察证据的新兴攻击进化Harness。在多骨干模型、多攻击类型与多证据形式上的实验显示,HASTE持续降低攻击成功率同时保留良性任务效用。项目页:https://github.com/xxiqiao/HASTE。