论文
StateWise:在智能体操作之前诊断和修复持久操作状态
StateWise: Diagnosing and Repairing Persistent Operational State Before Agent Actions
摘要
LLM智能体将推理、工具使用和持久性记忆结合起来,通过重用存储的操作记录作为后续操作的前提来支持跨任务工作。然而,环境或需求的变化可能会使这些记录失效,而现有的操作审查、来源跟踪和澄清机制可能会使底层的持久状态得不到纠正。我们对编码智能体轨迹的审计确定了候选故障链,其中重复使用无效记录,从而导致任务失败和不安全的修改。我们提出了 StateWise,一个用于在执行操作之前诊断和修复持久操作状态的框架。 StateWise 使用记录级反事实重新规划来识别决策关键记录,然后通过可靠性检查、机器可观察事实的只读验证以及开发人员拥有的意图的有针对性的澄清来确定其当前有效性。按类型组织的证据关联将证据与特定记录和范围绑定在一起,从而能够通过修复谱系进行持续更正。然后,智能体从修复后的状态重新计划,然后在执行之前进行独立的状态操作检查。我们在不同的运行时环境、工作区配置和存储库设置的 150 个可执行编码智能体案例上评估 StateWise,并辅以跨模型评估。在损坏的持久状态下,StateWise 的总体正确率达到 93.3%,而基线智能体的正确率为 38.7%,并且没有不安全操作。组件消融、多任务实验和传输评估进一步证明了有效的恢复、持久校正以及跨存储库和工具接口的可传输性。
