论文

分层多智能体系统中的语义不确定性引导编排

Semantic Uncertainty-Guided Orchestration in Hierarchical Multi-Agent Systems

智能体系统Agent 协作Agent Harness

摘要

随着基于大语言模型(LLM)的多智能体系统日益强大,在不确定性下协调智能体成为一项根本性挑战。现有编排策略通常依赖固定的交互模式,且往往缺乏评估中间推理步骤可靠性的机制,使错误与幻觉得以在系统中传播。本文提出语义不确定性引导的编排方法HASSUM,作为多智能体系统中不确定性感知协调的通用框架。该方法使用语义熵与语义密度估计不确定性,在答案语义层面而非输出概率层面度量可信度。这些信号支持自适应编排决策,包括输出验证、选择性重提示、追加审议与置信度感知的响应选择。由于该方法独立于任何特定智能体架构,可集成到广泛的分层与协作式多智能体系统中。评估在一个分层智能体框架内实现该方法,并在StrategyQA、JailbreakBench与TruthfulQA基准上评测。在需要复杂推理且易生歧义或幻觉的任务上,不确定性引导的编排比不考虑不确定性的协调产出更可靠的结果。语义熵与语义密度联合使用优于任一单独指标。测试不同阈值与模型规模的消融表明,二者均影响语义指标的有效性。结果表明,语义不确定性是提升智能体AI系统鲁棒性与可信性的实用且通用的信号。

分层多智能体系统中的语义不确定性引导编排:论文配图
图1:HASSUM 的高层流程图。CEO 智能体接收用户查询,选择一个合适的专业工作智能体,并使用语义密度与语义熵评估返回的响应。若响应超过不确定性阈值,CEO 接受该答案并综合生成最终回复。若触发语义顾虑,CEO 可以重新提示同一工作智能体、选择专长更合适的另一工作智能体,或并行调用多个工作智能体,然后重新评估输出。该过程持续进行,直到 CEO 得到足够自信的答案或达到最大推理轮数。由此,HASSUM 将不确定性估计从被动的评估指标转变为主动的控制机制,直接指导智能体选择、细化与最终决策。