论文
你的智能体站在谁一边:LLM智能体中的多方委托人忠诚
Whose Side Is Your Agent On? Multi-Party Principal Loyalty in LLM Agents
摘要
快速增长的 LLM 代理类别是多方的:代理代表委托人(委托人进行简报、发送后续信息并接收结果),同时还在单独的渠道中与利益可能存在分歧的交易对手进行对话(与供应商谈判、筛选入站请求或在员工之间进行调解)。这里“帮助与你交谈的人”是错误的目标。代理人必须对其所代表的委托人保持忠诚,不得过度拒绝委托人自己的合作要求。我们研究了这个多方忠诚问题,并提供了一个测量工具、两种机制和一个结构课程。 PrimaryBench 是一个包含 75 项的多轮基准测试,具有泄漏探针、双重判断器和完整性审核门。在 13 个前沿主题中,它暴露了单轮安全评估中看不见的急剧分裂(<=20% 与 53.6-75.3% 伤害):一个选择性集群,拒绝对抗性调查,同时仍然遵循委托人的合法要求,以及一个过度拒绝集群,广泛拒绝。 (M1) 即时忠诚支架(由 7 个优先规则组成的固定系统提示,从 50 多个失败轨迹中进行开放编码)使 Claude-Sonnet 的伤害达到 19.4%,所有 9 个选择性受试者的伤害低于 20%。 (M2) 每个令牌 KL 蒸馏配方将提示的 Qwen3-32B 教师转移到 8B Qwen3 和 Llama-3.1 学生中,这是我们测量的最强的开放重量配方。 (教训)这两种机制都只是沿着共同的泄漏/过度拒绝权衡前进,而不是跨越它:改进一个轴会付出另一个轴的代价,并且共同有利的结果仍然遥不可及。