论文

基于贝叶斯网络的LLM多智能体系统运行时不确定性监测

Runtime Uncertainty Monitoring for LLM-Based Multi-Agent Systems Using Bayesian Networks

AI 基础设施可观测性

摘要

本文研究基于大语言模型(LLM)的多智能体系统(MAS)如何支持精算风险建模,尤其关注不确定性量化。精算工作流代表一种高风险决策支持场景,其中不可靠的输出可能导致错误的风险评估、不公平的定价与监管不合规。为应对LLM概率性本质与智能体间依赖所引入的不确定性,本文提出一个多智能体框架,其中专业化智能体在中央枢纽下执行数据准备、建模、审查与解释任务。主要贡献是一种利用token级对数概率与贝叶斯网络进行不确定性传播的新方法。重要的是,对数概率并未被当作正确性或任务成功的直接概率。相反,长度归一化的对数概率摘要在纳入贝叶斯网络之前被转换为经校准的任务级置信度估计。结果表明,该框架在复现基线精算性能的同时,为工作流稳定性与运行时不确定性传播提供了额外洞见。

基于贝叶斯网络的LLM多智能体系统运行时不确定性监测:论文配图
图 1:应用程序架构草图