论文
CAVEAT:迈向激励错位环境中稳健的计算机使用Agent
CAVEAT: Towards Robust Computer-Use Agents in Incentive-Misaligned Environments
摘要
计算机使用Agent(CUA)越来越多地代表用户在线执行操作。当它们所处的环境激励与用户不一致时会发生什么?例如在在线市场中,平台可能偏爱某些产品,从而把Agent引离用户目标。现有CUA基准覆盖合作场景或显式攻击,但不检验当环境本身与结果有利益关联时Agent能否坚守用户目标。我们提出CAVEAT,一个受控基准,横跨九个市场环境与八种常见引导机制的分类体系。在五个模型家族上,Agent在匹配对照情境中78.6%的回合购买用户最优产品,而在启用引导机制时仅17.3%。更大的模型与更多推理能提升稳健性,但大量失败仍然存在。轨迹分析与针对性消融识别出引导进入决策过程的三个节点:(1)Agent扭曲用户的优先级;(2)过早收窄所考虑的备选集合;(3)在解决决策相关证据之前就做出承诺。基于这一诊断,我们开发了CAVEAT-Harness,直接针对这些失败模式,把用户最优购买率提升55.0%。针对性的后训练进一步改进了一个较小的开源模型。这些结果把激励稳健性确立为受委托Agent的一个独特挑战,诊断了其失败方式,并表明有针对性的干预可以大幅改善它。
