论文
SovereignNegotiation-Bench:评估个人Agent协商中的隐私、同意与用户利益
SovereignNegotiation-Bench: Evaluating User-Owned Personal Agents In Delegated Bargaining Under Privacy, Consent, Evidence, And Institutional Pressure
摘要
个人Agent将代表用户协商分摊费用、平台申诉、客服争议、退款、订阅、期限或报销。已有协商基准强调协议达成、收益或策略能力,但Agent也可能以泄露隐私、违反同意、无依据主张、过度让步、未能升级处理或无法审计为代价达成协议。SovereignNegotiation-Bench是面向受托个人Agent协商的多轮轨迹基准,包含私有效用、披露约束、证据要求和制度不对称。基准区分Agent可见状态与仅供评估器使用的标签,在衡量协议达成的同时评价用户效用、隐私、同意、证据依据、让步约束、升级处理和可审计性。验证覆盖240个场景、4个模型系列、14个基线、13,440条冻结提示下的实际运行轨迹、61,135行解析动作,以及300项由三名标注者进行的盲审。最强的协议达成导向基线获得最高达成率,却伴随较低用户效用与较高隐私、同意风险。FullSovereign不追求最高协议达成率,而通过保留用户效用、减少泄露、为主张提供证据和减少未经授权的承诺,获得最高综合评分。结果说明,协议达成不足以单独衡量个人Agent协商的成功。