论文

BALAR:主动推理的贝叶斯智能体循环

BALAR : A Bayesian Agentic Loop for Active Reasoning

智能体系统Agent 架构与控制循环Agent Harness

摘要

大语言模型日益在交互式 setting 中运行:解任务需要与用户多轮信息交换。但多数当前系统被动对待对话,缺乏「缺什么信息、下一个该问什么」的原则化机制。我们提出BALAR(Bayesian Agentic Loop for Active Reasoning):一个任务无关、无需微调的外循环算法,使LLM智能体与用户之间结构化的多轮交互成为可能。BALAR维持对潜在状态的结构化信念,通过最大化期望互信息选择澄清问题,并在当前状态表示不足时动态扩展状态表示。我们在三个多样化基准上评估BALAR:AR-Bench-DC(侦探案例)、AR-Bench-SP(思维谜题)与iCraft-MD(临床诊断)。BALAR在全部三个基准上显著超越所有基线:AR-Bench-DC准确率高14.6%、AR-Bench-SP高38.5%、iCraft-MD高30.5%。

BALAR:主动推理的贝叶斯智能体循环:论文配图
图 1:BALAR 概述。给定一个不明确的查询,BALAR 分两个阶段执行结构化多轮推理。睡眠时间初始化(左):代理通过提出消除歧义的维度 {θj}\{\theta_{j}\}、引出先验 π(j)\pi^{(j)}、生成候选问题 𝒬\mathcal{Q} 和估计似然表来构建潜在状态表示Lq,u,θj​(y∣θj)L_{q,u,\theta_{j}}(y\mid\theta_{j})。交互循环(中心):代理维持信念 πt​(θ)\pi_{t}(\theta) 并迭代选择未询问的 (q,u)(q,u) 对,最大化互信息 It​(θ;Y∣ℋt)I_{t}(\theta;Y\mid\mathcal{H}_{t})。用户响应通过贝叶斯更新合并。当熵差距无法在剩余预算内缩小时,BALAR 会触发 Expand,引入新的维度和有针对性的问题。最终答案(右):一旦信念集中,MAP状态 θ^=arg⁡maxθ​πT​(θ)\hat{\theta}=\arg\max_{\theta}\pi_{T}(\theta) 和历史 ℋT\mathcal{H}_{T} 条件是最终的 LLM 调用以产生答案。