论文

吸收惯性:计算机使用Agent的激活分析

Absorbed in Inertia: Activation Analysis for Computer-Use Agents

模型评测模型行为与机制分析

摘要

计算机使用Agent越来越能够根据屏幕截图、操作和推理的轨迹,通过自然语言指令在实时桌面上执行任务。我们发现他们可以悄悄地表现出惰性,尽管他们认识到这些行为是无效的,但他们仍然重复徒劳的行为。我们假设惯性反映在智能体的内部状态中,即智能体底层模型的激活值,并提出了一种协议来衡量两者之间的关系。对高维激活状态的广泛分析表明,惯性对应于激活空间的吸收区域,其中激活值在各个动作中甚至在尝试引导它们之后都会变得陈旧。我们推测,通过重新初始化Agent来彻底改变Agent的激活对于摆脱惯性是必要的。具体来说,我们提出了R$^3$(Reset、Reroute、Restore),它暂时重置Agent的上下文轨迹以逃离吸收区域,然后恢复历史上下文以有效地完成任务。相对于未修改的Agent,我们的方法在模型中的测量惯性降低了 17-55%。这些结果表明,改变上下文可以比直接控制所产生的激活更有效地中断重复。我们的代码可在 https://anonymous.4open.science/r/vlm-agent-defense-D076 获取