论文

学会选择:面向自适应方法选择的赋能引导语义通信多智能体系统

Learning to Choose: An Empowerment-Guided Multi-Agent System with semantic communication for Adaptive Method Selection

智能体系统Agent 协作Agent Harness

摘要

自动化科学计算工作流不只是生成可执行代码:自主系统还必须选择合适的计算策略、忠实地实现它们,并确保最终结果在因果上可归因于产生它们的决策。在多智能体管线中,这一过程尤为脆弱,因为智能体意图与行动之间的小幅不一致会导致语义漂移——最终执行的过程不再反映最初选定的策略,从而破坏下游的评估与适配。本工作受ATHENA框架(Toscano et al., 2025; Toscano et al., 2026)与赋能(empowerment)概念(Yiu et al., 2025)的启发,提出一个多智能体框架,将上下文老虎机与结构化的智能体间通信相结合,最重要的是引入贯穿全管线的语义检查点(semantic checkpoints)以保持行动与结果之间的保真度。该系统在自适应决策架构中集成了专门化的大语言模型(LLM)智能体、有据可依的代码生成与自愈式执行循环。通过赋能视角解读该框架,我们表明可靠的自主学习不仅需要识别高质量动作,还需要保持其在智能体间传播的完整性。以敏感性分析与不确定性量化工作流作为代表性案例研究,我们证明未加约束的语义漂移会损害策略学习,而所提框架提升了收敛性、鲁棒性以及对新问题情境的适应能力。这些结果为科学多智能体系统提出了更普遍的设计原则:自适应决策必须与保证语义一致性及全计算管线可靠信息流的显式机制相耦合。

学会选择:面向自适应方法选择的赋能引导语义通信多智能体系统:论文配图
图 1:用于自动敏感性分析 (SA) 和不确定性量化 (UQ) 的赋权稳定多智能体架构。该图展示了一个由七个语义检查点 (CP0–CP7) 保护的上下文老虎机循环,这些检查点跨四个验证层组织:传输、选择、实现和评估。概念化阶段将用户请求转换为结构化问题表示和上下文向量,而 CP0 将问题与历史档案进行比较,以区分熟悉的任务和异常的任务。战略团队提出候选方法并在实施前验证上下文兼容性。实施团队通过规划、模板检索、代码生成、检查和调试阶段将所选策略转换为可执行代码,其中 CP4 和 CP5 充当两阶段一致性门,以保持预期方法和组装实现之间的语义保真度。执行和评估层生成多模态观察结果,包括数值结果和图表,顾问对这些结果和图表进行分析,以产生接地奖励和诊断反馈。 CP6 确保奖励基于实际观察,而 CP7 则促进上下文老虎机政策中的行动多样性。 Register 更新交互历史记录并强制执行 submartingale 条件 𝔼⁡[Rn∣Hn−1]≥Rn−1\mathbb{E}[R_{n}\mid H_{n-1}]\geq R_{n-1},鼓励连续迭代中自主工作流程的单调改进。