论文

很少说谎,大谎:对LLM机器人团队的秘密内部攻击

Lie Rarely, Lie Big: Stealthy Insider Attacks on LLM Robot Teams

模型评测安全与风险评测

摘要

当一组机器人将计划和相互信任委托给LLM智能体时,单个受损的机器人可能会破坏共享的结果。我们在一项扎根的任务中研究这种威胁:一项多机器人调查,其中可以根据物理世界验证测量结果,但每个验证都会花费预算,否则会推进任务。我们将受损的机器人视为系统理论意义上的隐形对手:它不受能量限制,而是受到团队自己的探测器的限制。然后我们得出两个界限。首先,对手的报告被验证的概率在通信图中的度和验证预算方面受到限制。其次,任何隐秘对手造成的地图误差都受到对手偏差分布上的线性程序值的限制;它的解决方案是隐形预算和损害之间的汇率:低于临界验证水平,最严重的隐形攻击表明罕见的、全面的攻击最不可能被验证的记录,而在它之上,更好的购买是隐藏在噪音中的小偏差。在诚实机器人为LLM智能体的实验中,两个界限都保持在攻击实际花费的预算上。实验还表明,记录LLM机器人重新检查的情况是无偏的,但重新检查的次数是不可预测的。

很少说谎,大谎:对LLM机器人团队的秘密内部攻击的原论文方法或结果图
图2:(24)在操作点$\beta_{1}=0.05$、$V=25\sigma$处的汇率$\rho$。左:$\tilde{F}_{q}(\delta)/(q\,g(\delta))$ 比率,$\delta$ 在以概率 $q$ 验证的记录上每单位隐形预算所获得的伤害,对于 $q=0.35$(蓝色)和 $q=0.95$(红色)。它相对于 $\delta$ 的上界位于范围的末端:在完全谎言 $\delta=V$ 处,值为 $\rho_{V}(q)=\tilde{F}_{q}(V)/(q\bar{g})$ ($\square$),或在消失偏差处,具有极限值 $\rho_{0}(q)$ ($\circ$)。右:作为 $q$ 函数的两个最终值;汇率为$\rho(q)=\max\{\rho_{V}(q),\rho_{0}(q)\}$。分支在 $\bar{q}\approx 0.89$ 处交叉:最严重的隐形攻击在 $\bar{q}$ 下方是大胆的,在 $\bar{q}$ 上方是微妙的。点:第六部分两个诚实团队的经验验证水平。