论文

GUI智能体知道何时不该行动吗?使多模态GUI智能体具备冲突感知终止能力

Do GUI Agents Know When Not to Act? Enabling Conflict-Aware Termination for Multimodal GUI Agents

智能体系统Agent 动作执行与治理

摘要

图形用户界面(GUI)代理越来越多地用于在用户界面上执行自然语言指令,但真实用户可能会由于良性错误而发出不可行的指令。一个可靠的智能体不仅应该知道如何行动,还应该知道何时不行动。在这项工作中,我们引入了 CONFLICTGUI,这是一个涵盖指令内部冲突和指令 GUI 上下文冲突的基准测试,用于研究冲突感知终止。我们的评估揭示了严重的执行偏差过度服从:在可行任务上表现良好的代理通常会在相互冲突的指令下继续盲目执行。为了减轻这种行为,我们提出了 CONFLICTGUARD,这是一种推理时间框架,可以将代理的可行性意识与其行动生成保持一致。 CONFLICTGUARD 包含两个耦合组件:一个可行性验证协议,指导代理在行动之前评估指令逻辑和 GUI 端证据;以及一个条件动作调制机制,引导代理从过度合规的执行转向面向终止的行为。对五个广泛使用的代理进行的实验表明,CONFLICTGUARD 显着提高了平均冲突任务成功率,同时保持正常的 GUI 任务性能。这些结果验证了轻量级推理时间干预可以显着提高 GUI 代理识别不适当的执行场景并避免不必要的操作的能力。

GUI智能体知道何时不该行动吗?使多模态GUI智能体具备冲突感知终止能力:论文配图
图1 图形用户界面智能体方作出不可行的冲突意识终止指示的例子。(A):指示-内部冲突,用户指定的应用程序与预定目标不符。(B) 指令- GUI上下文冲突,用户请求与当前图形用户界面侧面的证据不一致。香草剂往往过分遵守指令的表面语义,而冲突Guard则终止通知用户特定冲突的任务。