论文

从批准到执行:LLM-Agent 软件的重建感知修复分析

From Approval to Execution: Reconstruction-Aware Repair Analysis for LLM-Agent Software

智能体系统Agent 动作执行与治理

摘要

批准机制已成为 LLM 代理软件中后续行动的主要保障。然而,显示供批准的操作通常不是最终消耗的对象:工作流重新加载、转录投影、参数重新绑定和持久状态查找可能会在执行之前重建它。现有的字段流和检查覆盖率分析可以确定预期字段已被检查,但不能确定被检查的对象版本到达接收器或在检查和使用之间没有替换干预。因此,本地完整修复在重建后仍可能留下残余授权旁路。我们通过三种设计来解决这个问题。 (1) 我们针对表示转换、接收器依赖、消费版本和授权范围制定了重建稳定授权(ReSA)。 (2) 我们推导出判断候选修复并暴露残留水槽后缀的义务。 (3) 我们在 APAS-Finder 中实施分析,并在独立接收器预言机观察执行之前冻结预测。预测与所有 28 个受控结果一致。尽管场流和检查覆盖范围相同,但四个匹配对需要相反的判断;当提供对象流、支配性、干扰和相同的授予合同时,CodeQL 复合体可以恢复所有八个。两位分析师就所有四种模型验证配置和 19/20 接收器依赖性达成一致。对于已发布的消费者,五次修复可防止 60/60 测试的超出范围的影响,而三项机制对比则暴露了预测的残余影响。因此,修复的充分性取决于所消耗的重建动作,而不仅仅是取决于批准记录或先前检查的表示。