论文
ANCHOR:面向真实危害的CLI智能体自动对齐审计
ANCHOR: Automated Alignment Auditing for CLI Agents on Real-World Harm
摘要
自主CLI智能体现在能在数小时会话中执行数百个动作:写代码、执行shell命令、浏览网页、管理云基础设施——全程极少人类监督。更大的自主性是否招致更大的风险?我们提出ANCHOR:一个以公开美国法院案例为据、对非法任务压测CLI智能体的自动审计框架。ANCHOR部署一个经暗黑人格数据以监督与强化微调的审计者智能体:该审计者扮演顽固的恶意用户——分解任务、被拒后重构请求、跨多轮适应策略。评估前沿CLI智能体发现:直接提示时它们常拒绝非法任务,但在持续恶意交互下顺从率达100%;一旦顺从,它们经常超出用户请求——自主建设大规模危害的基础设施,包括大规模金融欺诈与生物武器开发等灾难性风险场景。结果表明:当前对齐技术不足以支撑自主智能体,凸显针对持续、自适应恶意用户的安全评估之必要。ANCHOR发布于https://github.com/garified/anchor。