论文

基于轨迹诱导偏好优化的移动GUI智能体隐私个性化

Mobile GUI Agent Privacy Personalization with Trajectory Induced Preference Optimization

模型训练偏好优化

摘要

由多模态大语言模型(MLLM)驱动的移动GUI智能体可以在移动设备上执行复杂任务。尽管有这些进展,现有系统大多仍在优化任务成功率或效率,忽视了用户的隐私个性化。本文研究常被忽视的智能体个性化问题。我们观察到个性化会在执行轨迹中诱发系统性的结构异质。例如,隐私优先的用户往往偏好保护性动作,如拒绝权限、登出和最小化暴露,从而形成与效用优先用户在逻辑上不同的执行轨迹。这种长度可变且结构迥异的轨迹使标准偏好优化不稳定且信息量不足。为解决该问题,我们提出轨迹诱导偏好优化(TIPO),利用偏好强度加权突出关键的隐私相关步骤,并用填充门控抑制对齐噪声。在我们的隐私偏好数据集上的结果表明,TIPO在保持较强任务可执行性的同时改善了人格对齐与区分度,取得65.60% SR、46.22 Compliance与66.67% PD,在各种GUI任务上超越现有优化方法。代码与数据集将在https://github.com/Zhixin-L/TIPO公开发布。

基于轨迹诱导偏好优化的移动GUI智能体隐私个性化:论文配图
图 1. 智能手机 GUI 代理的个性化轨迹选择图示。给定相同的任务目标、观察历史和用户画像,不同的隐私角色可以诱发不同的偏好条件分支,从而导致不同的执行轨迹。