论文
人类引导的计算机使用智能体危害恢复
Human-Guided Harm Recovery for Computer Use Agents
摘要
随着语言模型智能体获得在真实计算机系统上执行动作的能力,我们不仅需要大规模防止有害动作的手段,也需要在预防失效时有效补救危害的方法。我们将这一被忽视的事后保障挑战形式化为危害恢复(harm recovery):在与人类偏好一致的前提下,将智能体从有害状态最优地引导回安全状态的问题。我们通过一项形成性用户研究为偏好对齐的恢复奠定基础,该研究识别出受重视的恢复维度并产出一份自然语言评分准则(rubric)。我们包含1,130个成对判断的数据集揭示了属性重要性的情境依赖变化,例如相比全面的长程方案更偏好务实的、有针对性的策略。我们将这些洞察操作化为一个奖励模型,在测试时对由智能体脚手架生成的多个候选恢复方案进行重排序。为系统性评估恢复能力,我们提出BackBench,一个包含50个计算机使用任务、测试智能体从有害状态恢复能力的基准。人类评估显示,我们的奖励模型脚手架产生比基础智能体和基于评分准则的脚手架更高质量的恢复轨迹。这些贡献共同为一类全新的智能体安全方法奠定基础——这类方法不仅通过预防来应对危害,还以对齐且有意的方式处置危害的后续影响。
