论文
AdaptArena:评估 Web Agent的测试时个性化
AdaptArena: Evaluating Test-Time Personalization of Web Agents
摘要
大语言模型(LLM)Agent在复杂的网络导航任务上表现出了强大的性能,但它们在用户意图未明确且偏好不同的现实环境中仍然很脆弱。在实践中,用户很少提供显式的配置文件,需要Agent从隐式信号中推断潜在的偏好。尽管它对于部署很重要,但在现有基准测试中,这个问题设置在很大程度上没有得到充分探索。为了解决这一差距,我们引入了 AdaptArena,这是一个通过隐式偏好推断评估网络Agent测试时个性化的基准。 AdaptArena 包含 480 个任务,具有单偏好和双偏好场景。每个评估任务都必须通过检索和利用隐式编码目标偏好的最相关的历史用户轨迹来解决。此外,我们还引入了 AdaptiveAgent,一个基于检索的框架,用于标准化评估隐式偏好推断。实验揭示了巨大的性能差距:虽然能够访问真实偏好的预言机Agent实现了 82.92% 的成功率,但使用我们的框架评估的 LLM Agent最多达到 15.62%。此外,我们发现正确推断用户偏好是必要的,但对于任务成功来说还不够,因为即使Agent与目标偏好一致,下游网络交互中的执行失败仍然是一个重要的瓶颈。这些发现强调隐式偏好推断和强大的行动基础是部署可靠、面向用户的网络Agent的关键挑战。我们发布我们的代码:https://github.com/McGill-NLP/web-agents-test-time-adaptations