论文
很少说谎,大谎:对LLM机器人团队的秘密内部攻击
Lie Rarely, Lie Big: Stealthy Insider Attacks on LLM Robot Teams
摘要
当一组机器人将计划和相互信任委托给LLM智能体时,单个受损的机器人可能会破坏共享的结果。我们在一项扎根的任务中研究这种威胁:一项多机器人调查,其中可以根据物理世界验证测量结果,但每个验证都会花费预算,否则会推进任务。我们将受损的机器人视为系统理论意义上的隐形对手:它不受能量限制,而是受到团队自己的探测器的限制。然后我们得出两个界限。首先,对手的报告被验证的概率在通信图中的度和验证预算方面受到限制。其次,任何隐秘对手造成的地图误差都受到对手偏差分布上的线性程序值的限制;它的解决方案是隐形预算和损害之间的汇率:低于临界验证水平,最严重的隐形攻击表明罕见的、全面的攻击最不可能被验证的记录,而在它之上,更好的购买是隐藏在噪音中的小偏差。在诚实机器人为LLM智能体的实验中,两个界限都保持在攻击实际花费的预算上。实验还表明,记录LLM机器人重新检查的情况是无偏的,但重新检查的次数是不可预测的。
