论文
稳定的智能体控制:面向自主网络防御的工具介导LLM架构
Stable Agentic Control: Tool-Mediated LLM Architecture for Autonomous Cyber Defense
摘要
在对抗压力下做高风险决策的智能体系统需要现有方法无法提供的正式保证。受安全运营中心(SOC)在对抗压力下配置端点检测与响应(EDR)策略的运营需求启发,我们提出工具介导架构:LLM智能体使用确定性工具(Stackelberg最优响应、贝叶斯观测更新、攻击图原语),并从在工具输出接口处强制执行的有限动作目录中选择。一个在Lean 4中机器验证、零sorry的复合Lyapunov函数认证了可控性、非对称传感器数据下的可观测性,以及智能对抗扰动下的输入到状态稳定性(ISS),两个推论把证书扩展到来自目录的任意控制器或对手。在282个真实企业攻击图上,上述主张以裕量成立。在成对攻防遥测上,工具介导的Claude Sonnet 4控制器较确定性贪心基线把攻击者期望收益(博弈值)降低59%,且四个温度下40次运行零方差。Claude Haiku 4.5控制器收敛到次优博弈值,但在另外40次运行中保持目录有界,证明架构稳定性不依赖控制器能力。LLM智能体的非确定性促进策略的创造性探索,而工具介导架构保证系统稳定。