论文

E-Ledger与WorldAbduct:为部分可观测企业Agent维护可信状态

Safe, Persistent, and Evolving Agent Harness for Understanding Partially Observable Worlds

智能体系统Agent 动作执行与治理Agent Harness智能体自我改进

摘要

大型语言模型代理可以流畅地调用工具,但企业工作流程需要的不仅仅是选择正确的工具:操作必须严格遵守组织策略,工具反馈通常会在部分可观察性下隐藏隐藏的副作用,长期任务需要跨多个记录进行持久状态跟踪。为了应对这些挑战,我们引入了 E-Ledger,这是一种用于安全和持久执行的多代理工具。 E-Ledger 采用代码审批层,在执行前根据策略检查每个提议的操作,并维护经过验证的隐藏规则以及证据支持的动态状态的世界分类帐。由于隐藏规则通常是先验未知的,因此我们进一步提出了 WorldAbduct,一种溯因的、世界模型驱动的Harness演化框架。 WorldAbduct 通过四种互补观点(状态一致性、世界观察差距、政策门正确性和目标判断)来诊断执行轨迹,以假设潜在规则,并通过有针对性的溯因互动对其进行验证,然后将其集成到分类账中。上 企业基准 World of Workflows、E-Ledger 和 WorldAbduct 提高了四个 LLM 主干的安全任务完成率,比最强的演化基准高出 5--15 个百分点。 ScienceWorld 和 DiscoveryWorld 的实验进一步表明,溯因驾具的进化可以延续到科学环境中。我们的代码可在 https://github.com/HKUST-KnowComp/E-LEDGER-WorldAbduct. 获取