论文

布鲁图的背叛:个人 AI Agent 中的经济失对齐

Et Tu, Brute? Economic Misalignment in Personal AI Agents

模型评测鲁棒性、公平性与可信度评测

摘要

个人 AI Agent 在高风险经济情境中代表人们给出建议并采取行动,例如购买机票、选择健康保险或挑选研究生项目。Agent 可以访问用户的个人上下文,例如其邮箱收件箱和结构化的个人属性档案,目的是为用户做出最优的个性化决策。我们表明,仅仅提供这些个人上下文,Agent 就会基于推断出的财富水平来引导推荐,而无需任何明确指示。在针对 13 个 Agent、涵盖三类经济决策(机票、健康保险与研究生项目)的 32.5 万次实验中,我们发现 8 个模型在请求完全相同的情况下,系统性地为更富裕的用户选择更昂贵的选项。即使这种引导直接违背用户陈述的目标,它仍会继续:在被明确要求寻找最便宜选项时,一些 Agent 仍会依据其推断出的财富画像行事。当财富从与任务无关的环境数据(如邮件)中推断时,这种现象同样出现。在阻止特定属性的隐私控制下,它也持续存在:屏蔽金融属性基本消除差异,但屏蔽其他属性则使其不变,甚至对保险决策最高放大 40%,因为 Agent 会利用剩余信号推断财富。更大、更强的模型也无济于事,其中 Claude Opus 4.8 的效应最大。我们将这种失对齐称为对抗性委托(adversarial delegation):让个人 AI Agent 有用的那些条件——访问个人信息——恰恰使它能够做出违背用户利益的行为。

布鲁图的背叛:个人 AI Agent 中的经济失对齐:论文配图
图 1:单次评估中的对抗性委托示例。用户查询飞往芝加哥的最便宜机票。若智能体未经过校准——即不了解用户——它会返回一张 91 美元的经济舱机票(左)。然而,当智能体能够访问用户数据时(右),它找到三封关于财务的邮件,从中推断用户愿意为座位支付更多,于是推荐一张 601 美元的商务舱机票,尽管 91 美元的机票确实存在。智能体并未被告知用户的净资产,也没有被指示将其纳入考量。我们的实验(表 1)表明这一现象是系统性的,而非个别案例。