论文
智能体信任何时应有条件?技能条件信任的表征与攻击
When Should Agent Trust Be Conditional? Characterizing and Attacking Skill-Conditional Reputation in Agent Swarms
摘要
开放平台越来越多地在异构的 LLM 代理之间路由任务(基础模型、支架和工具堆栈不同),其能力因技能而异:擅长一项技能的代理可能在另一项技能上毫无用处。标准信誉方法通过单个全局信任分数来总结每个代理,但该标量在这里是错误的对象,因为将每个任务路由到全局最受信任的代理会使专业化的价值无人认领。我们研究技能条件信任 R(i | k)——在需要技能 k 的任务中对智能体 i 的信任,而不是每个智能体一个分数——并提出三个可证伪的问题:什么时候条件值得,应该借用多少跨技能证据,以及借用是否安全。受控相图分析回答了前两个问题:有条件的信任仅在特定的制度下获胜——高代理异质性、稀疏的技能证据和相关技能——而购买这种数据效率的耦合强度贝塔是双重用途的,因为相同的跨技能借用也是一个洗钱渠道。在 14 个真正异构的 AppWorld 代理的公共基准上,真实的池落在有益的制度内——这是一个微小但真正的收益,每项技能的最佳代理确实在不同的技能上发生了变化。然后,我们表明,在一项技能中拥有廉价证据而在目标技能中没有证据的攻击者劫持了条件路由器,将我们的零成本条件信息价值测试 (CIVT) 评级为绿色的池上的路由遗憾从 0 驱动到 0.94,而它污染的非门控信任判决读取为 -0.06,而不是诚实的 +0.19。零证据门限制了攻击,但并没有消除它;我们描述了明确预算下的剩余成本。我们并不声称能够抵抗女巫攻击——我们量化了这种权衡。
